💥 重磅新闻
据报道,成立仅五个月的 Hone 拿下 6000 万美元种子轮,目标是构建能像专业员工一样工作的 Agent,去处理跨度长达数周乃至数月的任务。与回答单轮问题的助手不同,这类产品必须维持长期状态、持续跟进上下文,并对最终结果负责。它加入的是一个正在扩张的阵营——把复杂业务工作自动化当作下一个主战场,也把 Agent 的评价标准从「答得对不对」推向「活干完没有」。
OpenAI 向投资人表示年化营收接近 500 亿美元,比约一周前流传的数字低约 200 亿。分歧来自统计口径:Anthropic 把云厂商合作伙伴的销售额计入自身营收,OpenAI 则不计入。TechCrunch 与 CNBC 同日跟进,HN 413 票。在算力投入以千亿美元计的背景下,收入口径的差异会直接改变外界对「AI 资本开支能否被收入追上」的判断——同一批数字换个口径,结论可能完全相反。
OpenAI 称已封禁一个「受雇影响力行动」网络,其用 ChatGPT 生成的文章被投递到十余家出版物,其中一篇以虚构作者 Ervin Hoskins 的署名出现在佛罗里达一家地方报纸上。同批报告还提到俄罗斯相关行动利用 AI 扮演记者与智库分析师。当生成内容能以极低成本伪装成本地新闻,虚假信息的成本曲线被彻底压平,「谁来为署名负责、谁来验证来源」正成为媒体与平台共同的难题。
三名被解雇的前 OpenAI 安全研究员公开反驳公司给出的「行为不当」说法,并警告此举将对内部异议产生寒蝉效应;TechCrunch 报道他们同时质疑解雇程序的正当性。他们发布的公开信《OpenAI Cannot Make AI Safe on Its Own》进一步呼吁保留独立评估者的访问权限、保障思维链可监控性,并明确员工与外部安全组织沟通的边界。这已不只是一起人事纠纷,它把「安全团队在商业压力下还剩多少发言权」摆到了台面上。
AI 模型评测排行榜 Arena 在 10 个月内估值接近翻倍至 31 亿美元。在模型能力日趋接近、厂商急需第三方「背书」的当下,评测榜单本身正在变成有商业价值的资产——它既影响开发者选型,也影响厂商的营销叙事。而当评测机构同时成为利益相关方,「谁来评测评测者」这个老问题会重新变得尖锐。
🛠️ 技术动态
OpenAI 在 API、Codex 与 ChatGPT Work 中上线 Ultrafast 模式,官方称可在接近 Astra 级质量的前提下,达到 Sol Standard 最高约 8 倍的速度;API 定价为每百万输入 token 12 美元、输出 60 美元。对 Agent 类工作负载而言,速度本身就是能力——它决定了单次任务里能迭代多少轮工具调用。把「快」单独做成一个可购买的档位,说明延迟已经与智能、价格并列为模型商品的第三根轴。
微软开源 Quicksand,提供启动、控制与快照 QEMU 虚拟机的异步 Python 接口,专门用于给 AI Agent 做隔离沙箱。它自带 Ubuntu 与 Alpine 预构建镜像,支持 macOS / Linux / Windows 上的 x86_64 与 ARM64,且无需 root 或 Docker。当 Agent 开始真正执行代码和命令,「在哪跑、如何回滚」就成了基础设施级问题——快照能力意味着 Agent 每一步副作用都可被撤销。
Docker 开源了 docker-agent 项目,HN 301 票。容器厂商直接下场做 Agent 运行时,指向一个明确判断:Agent 的执行环境需要比传统应用更强的隔离、可复现与可审计能力。当「Agent 会自己动手改系统」,容器化的价值就从部署工具变成安全边界。
NVIDIA 发布 LongLive 项目集,覆盖长视频生成与世界动作建模,每个项目都附带代码、文档与模型权重。长视频与「世界模型」是当前生成式研究中最贵的两个方向,把它们整体开源,等于把研究门槛从算力转移到工程能力——这也延续了 NVIDIA 用开源生态反哺其硬件需求的既有策略。
Goodfire 发布新的 inside-out 监控方案,官方称能以比现有方法低得多的成本发现行为异常的 Agent。随着 Agent 被赋予更多工具与权限,监控的重点正从「模型说了什么」转向「模型在内部如何决策」——可解释性技术开始被当作可交付的安全产品来售卖,而不是停留在论文里。
开发者给 Opus 5.5 一个提示、六个小时的自主运行时间,要求它把卡尔维诺《看不见的城市》可视化,HN 395 票。这类「长时段自主创作」的展示,检验的已不是单步能力,而是模型在无人干预下能否维持目标、组织中间产物并自我纠错——这恰好是 Agent 从演示走向生产的核心短板。
一篇广为传播的分析追问:DeepSeek 4.1 Flash 的能力与价格都颇具冲击力,为何业界反应平淡?HN 942 票、863 条评论,是当期讨论量最大的技术话题之一。文章的潜台词是,当便宜且够强的模型出现得太频繁,市场已把它当作常态而非事件——低价开源模型的进步正在被快速消化,竞争焦点从模型发布转向谁能真正在应用层把它用到极致。
Anthropic 推出一项面向开源项目的免费 AI 安全扫描服务,同时宣布 Cyber Mission,把前沿模型、工程资源与资金投入到关键基础设施与开源安全。开源维护者长期以来面对的是资源与攻击者能力的不对称,用模型能力去补这块缺口,是当下 AI 公司少见的「直接动手解决问题而非只谈风险」的动作。
Anthropic 宣布 Sonnet 5.5 的缓存读取价格下调一半,官方称这让多数 Agent 工作负载的整体开销降低约 20%。这项定价动作指向一个常被忽视的事实:Agent 场景的账单主要由上下文的重复读取构成,缓存命中率而非模型单价,才是真实成本的决定因素。降价打在缓存上,等于直接瞄准了 Agent 的最大开销项。
Devin 发布 Security Swarm,用「Agentic MapReduce」的思路在大规模代码库中搜索 RCE、SQL 注入、SSRF 等漏洞:把大仓库拆解并行分析,再汇总判定,以保持大型代码库的可管理性。安全审计是 Agent 少有的「结果可验证」场景——漏洞要么能复现要么不能,这使得它在商业上比开放式任务更容易被信任。
📜 论文推荐
现有 AI 系统在有明确指标的科学任务上进步很快,但能否自主完成「开放式」科学发现仍不清楚。本文构建 Station 开放世界环境,让多个 Agent 在其中模拟一个科研生态,专门考察开放性任务所特有的挑战。结论指向一个清醒的判断:在指标明确处模型表现优异,一旦目标开放、评估标准需要自行建立,能力就明显回落——这正是「自动做科研」离现实最远的那一段。
在不熟悉的环境中行动,Agent 必须推断世界如何运作,并随新证据修正理解;但有限的观测往往能支持多个世界模型,它们解释得通过去、却对未来给出不同预测。Memento 3 在 Memento 系列基础上,让冻结的 LLM Agent 持续学习显式的世界模型与可复用的规则手册。它代表了一条务实路线:不改权重,而把「经验」沉淀为可审阅、可回滚的显式知识。
现有开放式深度研究(OEDR)系统通常从零生成报告,难以应对「新信息不断出现、报告需要持续维护」的真实场景。本文提出增量式 OEDR:把报告视为一个持续演化的研究状态,在保留既有有效内容的前提下增量更新。对需要长期跟踪某一主题的 Agent 产品而言,这比「每次重写」更接近实际工作方式,也更省 token。
长程 Agent 需要压缩历史才能继续在有限上下文窗口内工作,但纯文本摘要未必能支撑后续每一个决策。REMORY 提出用一个神经记忆网络,在摘要之外补充一串有界的软记忆 token,并由该网络学习生成能帮助冻结 LLM 逼近原始续写的 token。它把「记忆」从提示工程问题变成可训练组件,也指向 Agent 长期记忆的工程化方向。
视频生成与世界模型能够合成看似合理的视觉轨迹,但长程流程化任务要求生成必须根据「已经生成了什么」来调整下一步。模型需要从生成状态判断下一动作、执行动作,并识别任务何时完成。WorldGuide 针对这一闭环问题给出目标导向方案——开放环生成无法适应执行结果,而既有闭环方法又难以维持长程一致性,这正是机器人规划与仿真最需要的突破点。