VOL · 48

把今天的 AI
一杯咖啡读完

每日精选 · 一手源优先 · 看见 AI 浪��的真实方向

2026 / 07 / 24 · 周五

大 模 型
Grok 4.5
AGI Hunt / xAI 官方 · 今日

xAI 发布 Grok 4.5,全平台推送:1.5T 参数,编程成本仅为 Fable 5 的 1/5

xAI 今日全平台推送 Grok 4.5,iOS / Android / Web / X 全端可用。1.5 万亿参数 V9 基座,与 Cursor 联合训练,编程任务成本 $2.49(vs Fable 5 的 $11.80),推理速度 80 token/s。定价 $2/1M 输入、$6/1M 输出。

马斯克在 AI 竞赛中打了一张"够强 + 够便宜 + 全平台"的组合牌。Cursor 联合训练是差异化数据壁垒——用真实代码库交互数据训练,不是通用爬虫。但 1.5T 参数与 Opus 比仍有差距,性价比才是它的真实卖点。
DeepSeek V4
DeepSeek 官方 · 今日

DeepSeek V4 遗产模型今日退役:deepseek-chat / reasoner 永久下线,警惕隐蔽降级陷阱

deepseek-chat 和 deepseek-reasoner 今日 15:59 UTC 永久退役,无 grace period。V4 Flash(284B / 13B active)和 V4 Pro(1.6T)接管。1M context,输出 $0.28-0.87/M tokens。关键坑点:旧 reasoner 默认映射到 V4 Flash thinking mode 而非 V4 Pro。

三个月宽限期结束。对于还在用 deepseek-reasoner 的生产系统,今天是迁移 D-Day——不改就会挂。最容易被忽视的坑:旧 reasoner 映射到 Flash 而非 Pro,盲目重命名意味着推理质量静默降级。
每日经济新闻 · 昨日

阿里真武 M890 成功运行 Qwen3.8:国产芯片首破 2 万亿参数推理

阿里真武 M890 超节点成功适配 Qwen3.8(2.4T 参数),64 张芯片通过 ICN Switch 1.0 实现 800GB/s 互联,显存 9TB。国内首个成功运行超 2 万亿参数大模型的国产芯片超节点,已上线阿里云百炼平台。

自研芯片 + 自研模型 + 自研云服务——阿里在构建与英伟达生态差异化的闭环。但这是单实例 demo 还是可规模化的生产就绪?稳定性、性价比、生态丰富度才是真正考验。
A G E N T
钛媒体 · 今日

OpenAI 宣布 Atlas AI 浏览器 8 月停运:独立 AI 浏览器路线的终结

OpenAI 宣布 Atlas 浏览器 2026 年 8 月 9 日正式停止运作,9 个月实验终止。仅 macOS 单版本,未推 Windows / 移动端。浏览器能力并入 ChatGPT 桌面端。竞品 Tabbit(美团 / 光年之外)Agent 任务成功率已达 91.8%。

不是一款产品的谢幕,而是"独立 AI 浏览器"这个品类的终结。9 个月实验验证了两件事:用户不会为 AI 换浏览器,以及提示词注入风险高到不可接受。浏览器从入口降格为 AI 应用的附属模块。
Anthropic CMA
腾讯研究院 · 昨日

Anthropic CMA 技能上限 20→500,思考力度五档调速:从 API 到平台的关键一跃

Anthropic CMA 一次推出六项更新:技能上限 20→500,low 至 max 五档思考力度调速,种子会话最多 50 条初始事件,新增七种 webhook 覆盖环境与记忆存储全生命周期,子 Agent 可观测性下探到线程级。

500 个技能 ≈ 把整个企业的操作手册塞进 Agent 上下文。思考力度调速是聪明的成本管理——不同任务用不同算力。Anthropic 在 Agent 的工程化上比对手多走了一步:从卖模型到卖平台。
政 策
北京市政府 · 昨日

北京发布智能体引领发展若干措施:Harness Engineering 首次写入市级政策

北京市多部门联合印发《关于加快智能体引领发展的若干措施》,支持驾驭层工程(Harness Engineering),围绕上下文工程优化、任务持久化、多智能体协作、系统可扩展等夯实智能体共性底座,即日起实施。

Harness Engineering 被写入市级政策文件——智能体的工程化落地已从社区热词变成政府关注的基础设施层。这不是监管文件而是产业政策:重点不在"怎么管",而在"怎么建"。
Apple Intelligence
TechCrunch · 本周

Apple Intelligence 中国获批:集成阿里 Qwen 和百度搜索,22 个月审批终落地

经过约 22 个月审批,Apple Intelligence 通过集成阿里 Qwen(语言与图像理解)和百度(搜索)获中国监管批准。架构需支持模型按区域可插拔——中国区自动路由到国内合规模型。阿里股价受此消息上涨。

不是数据驻留 checkbox,是模型切换。中国的合规逻辑迫使苹果做了一件反而有长期价值的事——让底层模型可插拔。这套区域化模型路由架构,未来可能有比合规更大的商业弹性价值。
前 沿 技 术

Frontier · GitHub & arXiv 周边

Hermes Agent
GitHub / NousResearch · 4 天前

Hermes Agent v0.19.0「水银快闪」:2,245 commits,首轮响应提速 80%

NousResearch 发布 Hermes Agent v0.19.0,自 v0.18.0 起 2,245 次 commits、1,065 个 PR、450+ 贡献者。首轮响应延迟降低约 80%,新增智能审批、密钥管理、多 Profile 路由。已发布 Docker / PyPI / 自托管部署。

开源 Agent 框架从"能跑"跨越到"跑得快、跑不丢、管得住"。2,245 个 commits 不是小修小补而是底层基础设施重构——速度、稳定性、治理一块补,Agent 框架的工业化进程开始了。
OmniRoute
GitHub · 本周

OmniRoute 27.2K★:一个 endpoint 接入 290+ 模型供应商的 MIT 免费网关

OmniRoute 今日 1,929 stars,总计 27.2K。MIT 协议,一个 endpoint 接入 290+ 提供商(90+ 免费),500+ 模型。支持 RTK + Caveman 压缩节省 15-95% token,内置 MCP / A2A 协议,500+ 贡献者。

MCP 生态正在从"协议层"向"路由层"堆叠。底层是 MCP 标准接口,中层是 OmniRoute 这样的统一网关。一个 endpoint 打天下的愿景越来越近——但对模型厂商来说,这是好事还是坏事?
open-code-review
GitHub / 阿里巴巴 · 本周

阿里开源 open-code-review 11.6K★:确定性 AST + LLM Agent 混合代码审查

阿里开源 open-code-review,今日 180 stars,总计 11.6K。Go 语言,混合架构:确定性 AST 管道 + LLM Agent 推理,精确行级评论。内置 NPE / 线程安全 / XSS / SQL 注入规则集,阿里内部规模化验证,兼容 OpenAI & Anthropic API。

不是又一个"让 AI 看看代码"的玩具。确定性规则 + Agent 推理的混合架构意味着能落 CI Pipeline——100% 自动化的代码审查比 100% 准确的更有实际价值。阿里内部验证的规则集是真正的护城河。