🛠️ 技术动态
微软首个原生实时语音模型 MAI Realtime 以隐藏 Early Access 条目形式出现在 MAI Playground 中。系统支持全双工双向对话(边听边说),两个声音均比现有 Copilot 语音模式自然得多。预计将上线 Microsoft Foundry 和 Copilot 语音,但具体时间表未披露。
约 80 万人在 5 月的 Google I/O 后预订了 AI Studio Android 应用,但 Google 最终决定将其 vibe coding 工具整合进 Gemini 而非独立发布。此举延续 Google 的「单一 AI 入口」战略,Web 版 AI Studio 继续保留供需要完整能力的用户使用。
Google 个人 AI Agent Gemini Spark 已登陆 Chrome,能替用户完成「预约公寓看房」「搜索航班并启动订票」等浏览任务,但涉及付款的操作仍需人工确认。同时从 AI Ultra 专属扩展至 AI Pro 用户,覆盖全球 160 个国家,普惠门槛大幅降低。
Andrej Karpathy 要求 Opus 5 将《指环王》第一段用 Three.js 渲染,模型在 100 万 token 预算内返回 5500 行程序化动画代码,协调了全部多边形资产并按故事节奏编写动画逻辑。HN 595 票热议,被视为 LLM「人类无法企及的耐力任务」的新型评测范式。
字节跳动发布视频生成模型 Seedance 2.5,HN 434 票。新版本强化了「一镜到底」长视频生成能力和灵活的参考引用机制,能够在保持风格一致性的同时支持场景、人物、道具的灵活替换。
Wafer AI 发布测试报告,在 AMD MI355X 上运行 Kimi K3 的性能/价格比优于 NVIDIA B300。HN 212 票,引发对 AMD AI 加速卡竞争力的广泛讨论,也再次印证开源模型在非 NVIDIA 硬件上的适配进展。
📜 论文推荐(HuggingFace Papers)
阿里巴巴发布 Qwen-UI-Agent 技术报告(292 票),提出面向真实设备可靠运行的 GUI Agent 愿景:跨平台工作流执行、GUI 交互与 CLI 执行结合、支持长流程任务。这是目前 GUI Agent 领域最全面的基础模型技术报告之一,涵盖真实场景评测基准体系。
提出将 RLVR(可验证奖励强化学习)的应用范围从数学/编码扩展到开放领域的新框架 RLSVR,通过任务转换(Task Transformation)将非结构化问题转化为可自我验证的形式,实现大规模 LLM 自我改进(65 票)。
针对 Decoder-only 语言模型将长期记忆和推理混合在单一参数集中的问题,提出 Memory Decoder 架构,引入独立的参数化长期记忆模块,可在不重训基础模型的情况下独立扩展记忆容量(51 票)。
现有世界模型只回答「物理世界如何演变」,该论文提出「心理世界建模」范式,让模型推理隐藏的心理状态(信念、欲望、意图、情感、社会规范),对构建理解人类行为的 Agent 具有重要意义(48 票)。
对词法检索(BM25)、稠密检索、图索引、Agentic 搜索四种 RAG 范式进行受控大规模扩展研究,结果显示 BM25 在多数场景下成本效益最优。研究揭示了不同 RAG 范式在准确率、延迟、成本三个维度的扩展规律(46 票)。