AINVIDIA Newsroom
NVIDIA Groq 3 LPX 推理芯片正式量产——刷新每秒 3,400 词元纪录
NVIDIA于8月24日宣布,专为AI代理工作负载设计的推理加速器 Groq 3 LPX 已进入量产阶段,AI云服务商 Nebius 成为首家商用客户。在运行 Gemma 4 31B 模型(10万词元上下文)的测试中,该芯片以每秒3,400个输出词元创下新纪录,速度是竞争对手的4倍。这标志着NVIDIA 2025年12月以200亿美元收购 Groq 资产后的首次商业化落地。
解读
Groq 最初是一家凭借超低延迟推理能力赢得开发者追捧的AI芯片初创公司;被NVIDIA收购后,其技术被整合进 Vera Rubin 平台,承担推理专用层的职能。代理型AI的工作模式决定了它对低延迟有着高于吞吐量的需求——其任务需要快速、反复地执行-观察-再执行的循环。此次进入量产意味着企业云客户可以正式采购 Groq 3 LPX 算力,标志着高速推理正在成为一个独立的商业产品类别。
HaLVision 观点
AI API 的响应速度直接影响网络应用、聊天机器人和代理工作流的用户体验。随着 Groq 3 LPX 产能爬坡,单次推理成本有望下降,最终为下游API采购方带来红利。我们将持续关注采用该芯片的云服务商是否将成本优势传导至延迟敏感型模型的定价层。
阅读原文 ↗AIOpenAI
OpenAI 在 Hot Chips 2026 公布 Jalapeño 推理芯片首批基准测试结果,性能优于 NVIDIA Blackwell
8月25日,OpenAI 在斯坦福举办的 Hot Chips 2026 大会上公布了与 Broadcom 联合研发的自研推理芯片 Jalapeño 的首批公开基准数据。在 SemiAnalysis 的 InferenceX 测试中,Jalapeño 在单用户词元数与单千瓦功耗吞吐量两项指标上均超越了 NVIDIA Blackwell 系统。预计将于2026年底开始小批量部署,仅供 OpenAI 内部使用,不对外出售或租用。
解读
OpenAI 长期以来是 NVIDIA 规模最大的推理算力客户之一,转向自研芯片的核心目标在于降低对第三方GPU供应的依赖,并实现对单次推理成本的直接管控。Jalapeño 专为LLM推理场景设计,据称能够同时实现高吞吐量与低延迟,突破了推理硬件中二者通常难以兼得的瓶颈。由于该芯片不对外销售,对企业级API买家的影响是间接的:若 OpenAI 的算力成本下降,未来API定价也可能随之走低。
HaLVision 观点
Google TPU、Anthropic合作项目、以及此次OpenAI的Jalapeño——大型AI实验室纷纷布局自研推理芯片,本质上是对整体推理成本的系统性压降,最终将惠及所有用户。对于通过API使用AI的中小企业而言,硬件层竞争加剧意味着单次词元费用将长期走低——这是一个积极的结构性信号。
阅读原文 ↗AIOpenAI Help Center
OpenAI o3 今日正式从 ChatGPT 模型列表下线——90天过渡期结束
8月26日,OpenAI 完成了 o3 在 ChatGPT 中的90天退出过渡期,正式将其从模型选择器中移除。付费用户将无法在 ChatGPT 中继续手动选用 o3。API 访问暂无变化,但特定快照版本的 API 将于2026年12月11日起停止服务。
解读
o3 于2025年4月发布时是 OpenAI 能力最强的推理模型,在数学、科学和编程基准测试上均取得重大进步。到2026年8月,o3-pro、o4-mini 及 GPT-5 系列模型在大多数任务上已全面超越 o3。从 ChatGPT 模型选择器中移除旧版模型,是 OpenAI 精简界面并将算力集中于主力模型的一贯策略。相对较长的 API 下线时间窗口,为有生产集成的开发者预留了充足的迁移时间。
HaLVision 观点
如果客户或内部团队有手动选用 o3 的 ChatGPT 工作流,今日起将直接受到影响,建议立即排查。生产级 API 集成用户在12月11日前有充裕时间完成迁移。对于大多数任务而言,o4-mini 可在相同价格下提供持平甚至更优的性能,整体迁移成本可控。
阅读原文 ↗WebNext.js Blog
Next.js 8月安全更新:v16.3.3 / v15.5.24 修复两个严重漏洞
8月25日,Next.js 提前一天发布了2026年8月安全版本,修复了 v16.3.3 和 v15.5.24 中两个严重(Critical)级别的漏洞。修复内容涵盖:通过 Server Actions 引发的拒绝服务(DoS)、Turbopack 场景下的中间件/代理绕过、通过重写规则的 SSRF、响应体缓存混淆,以及内部服务函数端点的未授权信息泄露等多个高危问题。
解读
Next.js 于2026年引入月度安全发布机制,为工程团队提供可预期的修复窗口。本次8月更新提前一天发布,原因是内部审查发现了第二个严重级别漏洞。本次修复的漏洞类型——无界 Server Action 载荷导致的 DoS、攻击者可控重写目标引发的 SSRF,以及未授权的端点信息泄露——均可被未经认证的用户在公网可访问的应用上直接利用,需立即处理。
HaLVision 观点
所有运行 v15 或 v16 的 Next.js 项目应立即优先更新。仍在使用 v13 或 v14 的项目无法获得此补丁,建议以今日为契机提上版本迁移日程。从高知名度框架的历史漏洞来看,概念验证利用代码往往在补丁发布后数日内便会出现,切勿拖延至下周处理。
阅读原文 ↗WebSvelte Blog
Svelte 8月月报发布——SvelteKit 3 预览版重构路由 API
Svelte 团队发布了2026年8月月度更新,SvelteKit 3 预览版是本期最大亮点。主要更新包括:`goto` 内置 shallow routing 支持(新增 state 选项)、将 `invalidateAll` 替换为 `refreshAll`、新增 `$app/manifest` 模块用于运行时审查构建输出,以及重构 `$app/service-worker` 模块。此次更新同时包含错误处理 API 和构建适配器的破坏性变更。
解读
SvelteKit 3 以 Svelte 5 的 Runes 响应式系统为基础,整理了 v2 中已标记为废弃的模式,并对路由、错误处理和 Service Worker API 进行了一致性重构。迁移时需逐一排查 `invalidateAll`、`pushState`、`replaceState` 的使用情况,并同步升级构建适配器版本。一项实用的静默改进是:SvelteKit 现在能自动检测新部署,并在数据响应、远程响应和表单响应中感知到更新时提示用户刷新——对需长时间保持打开状态的网络应用尤为有用。
HaLVision 观点
对于不需要 Next.js 完整功能集的新项目——企业官网、活动页、落地页——SvelteKit 3 正在成为一个简洁高效的有力选项。现有 SvelteKit v2 团队应密切跟进 Changelog,提前评估迁移范围。自动部署检测功能则是一项能切实提升用户体验的实用改进。
阅读原文 ↗