💥 重磅新闻
OpenAI 推出 Sol 与 Luna 两款新模型,定位为 GPT-6 Astra 的更快、更便宜替代品,把 Astra 在编码、事实准确性、计算机使用和专业任务上的提升延伸到低成本层级,免费与 Go 用户仅可使用 Luna。同期 OpenAI 提高了 GPT-6 的默认 prompt cache 命中率,对 30 分钟内复用的共享前缀追加折扣,并推出缓存性能监控与诊断工具。HN 1662 票、798 条评论,位列当日热榜第二。
Anthropic 称 Opus 5.5 在多数工作负载上匹配 Claude Fable 5.1,成本却比 Opus 5 低 40%,并在公司自研的自动化行为审计中取得历史最好成绩,同时针对网络安全场景加入了更严格的防护。Anthropic 同步发布成本拆解:更低的输入/输出 token 单价叠加大量缓存读取共同压低单次任务成本,实际花费取决于轮次数量、缓存使用率与模型选择。HN 1686 票、1026 条评论,当日热榜第一。
五角大楼表示,对 AI 输出的过度依赖是造成伊朗学校导弹袭击事件的因素之一,另一项独立调查也指出行动中对 AI 的依赖超出合理范围。同期 CNN 报道称,美军曾基于一份「完全虚假」的 AI 生成报告险些拦截一艘中国船只——官员发现聊天机器人错误识别了船上货物。这一系列事件把「AI 结论未经人工复核即进入杀伤链」的风险推到台前,也直接推动了前线模型第三方独立评估的呼声。HN 800 票、418 条评论。
成立七年的 Snorkel AI 完成 3.5 亿美元 E 轮融资,估值升至 35 亿美元,为上一轮的三倍。公司主打「数据即服务」路线,为模型训练提供高质量标注与数据开发能力。在合成数据泛滥、高质量人类标注愈发稀缺的背景下,训练数据供应链正在成为模型能力差异化与定价权的关键环节。
OpenAI 的 Sam Altman 和 Anthropic 的 Dario Amodei 将向联合国安理会就 AI 安全与监管发表讲话。与此同时,加拿大、德国、阿联酋、新加坡等 20 个国家以及欧盟委员会签署了加强前沿模型检查的声明,但美国与中国均未加入。全球 AI 治理的分层格局正在固化:多边机制加速推进,两大 AI 强国选择缺席。
特朗普表示美国将正式把 AI 改称为「超级智能」,此前他还就替代名称征询意见,候选包括 Superior、Extreme、Supreme Intelligence,同期又提出组建「AI Force」的构想。这一表态延续了其以命名与话语权介入 AI 议题的风格,也引发质疑:监管实质内容是否跟得上名称的变化。同期加州则在收紧 AI 数据中心的能耗与用水规则,得州已暂停数据中心许可等待电网审计。
Meta 此前声称 Muse 是「从零构建」,如今承认这款 AI 助手「大量借鉴」了开源项目 OpenClaw——连部分工作区文件名与内容都一致。Muse 上线后登顶美国 iOS 下载榜,但原创性争议正在消耗口碑;同期 Meta 还修复了一个可让攻击者控制 AI 代理的零日漏洞。HN 上有开发者实测向 Muse 索要文件系统,结果收到了 6.8GB 数据。
🛠️ 技术动态
小米上线 MiMo v2.6 模型。该消息在 HN 获得 1114 票、475 条评论,位列当日热榜第三,仅次于 Claude Opus 5.5 与 GPT-6 Sol/Luna——在两家美国头部实验室发布新模型的同一天拿到这个位置,讨论焦点集中在国产模型的迭代节奏、开放权重路线,以及手机厂商自研模型与端侧部署的结合路径。
xAI 发布 Grok 4.7,HN 603 票、520 条评论。同期 The Verge 报道特斯拉上线 Grok Bot,可接管收件箱、日历和文件操作,仅面向每月 300 美元的 SuperGrok Heavy 订阅用户开放(beta)。Grok 正从对话模型向「代理 + 终端入口」的产品形态扩展,而高定价也把它明确框定在高端订阅层。
Scale 发布 SWE-Bench Pro V2,包含来自 11 个代码仓库的 642 个任务,修正了此前任务中的错误并细化了评测标准。结果显示 GPT-5 与 Claude Opus 4.1 在公开集上仅约 23%,远低于它们在 SWE-Bench Verified 上的成绩,说明新基准更贴近真实工程难度。顶尖模型在不同任务与语言间表现稳定,小模型在多文件复杂场景中明显吃力。
Perplexity 将拒绝采样微调与提示引导的自蒸馏结合,让 Computer 模型同时从成功会话和「被用户纠正的失败会话」中学习。相比只用成功轨迹,把用户修正纳入训练信号能让模型更贴近真实工作流中的纠错模式——这也把「用户纠正」从产品体验问题转化为训练数据资产。
vLLM 新增硬件无关层,在 NVIDIA H100 上可达到原生实现最高 96.6% 的效率,同时保持 torch 可编译与可扩展。这一改动让新 GPU 特性不再把老卡或小众加速器用户甩在后面,对推理栈的可移植性与国产/非英伟达加速器的生态接入有实际意义。
RRSI 针对 Agent harness 的递归自我改进过程做正则化,用于抑制基准过拟合。在八个基准上,它提升了分布外(OOD)性能,同时消耗的策略 token 更少——说明「让 Agent 自己改自己」可以不必然以牺牲泛化为代价,这对自动化 Agent 优化流水线的可信度很关键。
高通发布两款新智能手机芯片并强调 AI 能力,称新款旗舰芯片可在本地运行 30B 混合专家(MoE)模型。端侧可运行的模型规模继续上探,手机正在成为推理部署的一类重要载体——这对隐私敏感场景和离线可用性都有直接影响。
中国最大存储厂商长鑫存储(CXMT)称其制程能力已达到最先进量产节点水平,第五代 DRAM 平台进入量产,每片晶圆可多产出至少 50% 的裸片,两款 24Gb LPDDR5X 产品容量比前代 CXMT 产品高 50%。在 AI 内存需求持续紧张、HBM 产能成为 GPU 交付瓶颈的背景下,这一进展直接影响存储供应链的定价格局。
💡 深度分析
Khosla 认为个人 AI 的竞争最终落在两点:用户是否信任这家公司托管自己的敏感数据,以及产品能否可靠地把事情做完。他同时指出 Meta 在信任维度处于结构性劣势。这一框架把「模型能力」之外的分发与信任资产放到了同等位置,也解释了为什么能力更强的模型未必赢得个人助理市场。
有开发者发现 Claude Code 仅在遥测开启时读取 AGENTS.md,该行为随后被修复。案例暴露出 AI 编程工具的隐性行为耦合:项目约定文件是否生效,竟然取决于一个与功能无关的隐私开关。HN 338 票、183 条评论,讨论集中在 Agent 工具链的可观测性与「默认行为应当可预期」这一基本要求。
Linear 分享了 AI 辅助编程带来的连锁效应:代码产出速度大幅提升后,持续集成成为新的瓶颈,团队因此重构了 CI 流水线以匹配新的开发节奏。HN 311 票、397 条评论讨论从代码审查到部署自动化都需要适配 AI 时代的产出速率——AI 提升的是写代码的速度,而瓶颈只是被推到了下游。
文章认为当 AI 承担越来越多的思考与决策,人类不仅失去练习判断的机会,也失去积累智慧的路径。HN 382 票、535 条评论围绕 AI 辅助工具是否在系统性削弱人的认知能力展开争论。同期另一篇《我不想读你没写的东西》(HN 1029 票、449 条评论)指向同一焦虑的另一面:AI 生成内容正在稀释信息的可信度与密度。
文章主张用「间谍标记」而非水印来追踪 AI 生成内容:水印以鲁棒性为目标、易被规避,而植入可验证的隐蔽标记更贴近真实威胁模型下的取证需求。HN 673 票、165 条评论讨论了内容溯源在监管压力下的技术路线选择——当「必须能证明这段内容出自哪个模型」成为合规要求,方案设计需要先明确对抗谁。