💥 重磅新闻
SemiAnalysis 深度分析 OpenAI 自研推理加速器 Jalapeño,在 GPT-OSS 120B 上的早期基准测试显示,峰值吞吐量和 token 延迟均优于 Nvidia 商用系统。芯片将 prompt 处理和 token 生成紧密耦合,AI 辅助设计了电路和内核。计划年底前部署到自有基础设施。HN 560 票 354 条评论。
Stripe 宣布收购 AI 模型聚合平台 OpenRouter,将支付系统与多模型接入层整合。OpenRouter 连接开发者与各类 AI 模型并聚合计费,收购后 Stripe 用户可更便捷地在支付流程中调用 AI 能力。《纽约时报》报道交易金额约 75 亿美元。
Bloomberg 报道中国 Z.ai 证实此前以化名 Ox Alpha 隐秘测试的模型属于 GLM 系列,性能对标 DeepSeek,并将公开发布模型权重。HN 357 票讨论中国大模型竞争格局变化。同日 Z.ai 还发布了 GLM-5.3-Flash(HN 313 票)。
Perplexity 发布 Portable Computer,AI 模型、用户数据和工作全部留在本地设备上,零 token 成本。每个任务默认从设备端启动,仅在需要更强能力时才请求许可上云。需 RTX 24GB+ 显存,现已支持 Linux,Windows 9 月上线。优先在 Nvidia DGX Spark 上推出。
Apple 发布 M6 和 M5 Ultra 芯片,面向 Mac mini 和 Mac Studio,扩展本地模型运行能力。同时推出搭载 M5 Max 和 M5 Ultra 的新 Mac Studio,以及搭载 M6 和 M5 Pro 的新 Mac mini。HN 1264 票,1213 条评论,成为当日最受关注的硬件发布。
🛠️ 技术动态
阿里通义千问发布 Qwen3.8-Flash-Next,采用全新架构(125B 总参数 a6B 激活),目标极致推理成本效率。已在 ModelScope 上线模型页面。HN 332+331 票讨论 MoE 架构在成本效率方面的突破。
Z.ai 发布 GLM-5.3-Flash 推理模型,HN 313 票 130 条评论。与同日确认的 Ox Alpha 同属 GLM 系列,中国大模型竞争持续白热化。
OpenAI 官布 GPT-5.6 Sol API 价格下调,降价将持续至至少 11 月 21 日。HN 336 票 338 条评论讨论模型价格战加速,推理成本持续下探。
Anthropic 将 Claude 聊天和 Cowork 的记忆系统打通,两个平台共享同一套对话记忆。记忆功能默认开启,Claude 在对话中自动将话题存入记忆。用户可在 Topics 设置中逐条查看、编辑或删除记忆项,敏感话题(健康、信仰)需手动开启才会保存。
IBM 发布 Granite 4.2 系列,包含 3B、8B、30B 三种规模的稠密解码器推理模型,训练数据量 15T tokens。采用五阶段训练策略含多阶段 RL 流水线,支持原生工具调用,内置 THINKING/NON-THINKING 开关。8B 和 30B 模型在真实环境中通过 RL 学习代码编辑和网页搜索等 Agent 行为。
Arduino 与 Qualcomm 推出 Ventuno Q 边缘 AI 开发板,搭载 Qualcomm Dragonwing IQ8 处理器,提供 40 TOPS 算力及独立实时微控制器,可在完全离线状态下处理视觉、语音和传感器数据,面向自主机器人和智能设备。被称为 Arduino 史上最强大的开发板。
Vercel Connect 正式发布,以运行时签发的短期凭证替代长期 API Token,凭证按任务范围限定并自动过期。GA 版本新增 100+ 连接器,统一集成模型并加入生产级治理控制,解决 AI Agent 的凭证管理问题。
Applied Compute 发布 AC2 平台,为 AI 团队提供模型训练、部署和迭代的一体化能力,支持自定义模型全生命周期管理。