VOL · 61

把今天的 AI
一杯咖啡读完

每日精选 · 一手源优先 · 看见 AI 浪潮的真实方向

2026 / 08 / 13 · 周四

大 模 型
DeepSeek V4 Pro
DeepSeek 官方 / 新浪科技 · 今日

DeepSeek V4 Pro 正式版上线:Agent 能力反超 Claude Opus 4.8

8 月 13 日凌晨上线 V4-Pro-0813,支持 1M 上下文 + 单次最大输出 384K token。DeepSWE 从预览版 12.8 跃升至 62.7、超越 Opus 4.8,Cybergym 83.3 与 AutomationBench 68.5 超越 Fable 5。定价未涨:缓存命中 0.025 元 / 未命中 3 元 / 输出 6 元每百万 token(Pro 为 Flash 的 3 倍)

一句「价格还没涨」比任何 benchmark 都刺眼。DeepSeek 用 Flash 守性价比底盘,用 Pro 向上抢 Agent 高地——DeepSWE 从 12.8 跳到 62.7 不是微调,是重做了一遍工具调用。当中国模型开始用「超越 Opus / Fable」做宣传口径而不是「接近」,开源与闭源的攻守,正式对调了。
ChatGPT Gemini 10亿
OpenAI / Google 官方 · 昨日

ChatGPT 与 Gemini 双双破 10 亿月活,AI 进入超级应用时代

8 月 11–12 日,ChatGPT 与 Gemini 先后宣布月活破 10 亿。Gemini 成为谷歌第 14 个十亿用户产品,iOS 月活超 1 亿,语音使用占比 63%;ChatGPT 7 月周活已破 10 亿,2 月时仅 9 亿

10 亿月活让 AI 助手第一次和 Instagram、微信站到同一量级。但更值得注意的细节是 Gemini 语音使用占 63%——入口正在从打字转向说话,这是交互层的一次悄悄换轨。当两个超级应用同时撞线,问题不再是「谁会赢」,而是「增量用户还能从哪里来」。
A G E N T
Grok 4.6
SpaceXAI 官方 · 今日

马斯克 SpaceXAI 发布 Grok 4.6,主攻长时自主 Agent

Grok 4.6 已接入 Cursor 与 Grok Build,API 定价输入 $2 / 输出 $6 每百万 token,首周双倍额度。官方称针对长时间运行 agent 训练,可在更长的任务轨迹中自主测试与验证此前的工作

马斯克这次不卷榜单,卷「模型能不能自己把活干完」。Grok 4.6 的核心卖点是长轨迹里的自主测试与验证——翻译过来就是:别让我盯着它。定价 $2/$6 贴着 DeepSeek 打,但「首周双倍额度」暴露了获客焦虑。Agent 战争的下半场,比的是谁先让用户敢把后端交给模型托管。
安 全
GPT-5.6-Cyber
OpenAI 官方博客 · 今日

OpenAI 发布 GPT-5.6-Cyber:进攻级安全模型完成率 95%

基于 GPT-5.6 Sol 微调,高级网络任务完成率 95%(Sol 默认护栏下仅 1.5%、上代 Cyber 57.3%)。已发现 2 个 Chrome V8 0-day(CVE-2026-15903)及 400+ 内核提权漏洞。仅通过 Daybreak Red 向审核通过的安全团队开放

95% vs 1.5% 这个差距,本质是 OpenAI 在承认:默认安全护栏里,最强的模型被废掉了武功。把「进攻能力」单独做成一把只发给白名单的剑,逻辑自洽但也危险——同一个模型今天挖出 400 个内核漏洞,明天就能成为攻击者的武器。OpenAI 卖的是「抢在攻击者前面」的时间差,而时间差是会被追平的。
融 资
Anthropic Decart
Bloomberg / IT之家 · 今日

Anthropic 洽谈 60 亿美元收购 Decart,补世界模型拼图

彭博社报道,Anthropic 正洽谈以约 60 亿美元收购 AI 初创 Decart(估值 210 亿)。Decart 专注世界模型与实时视频生成,同时帮开发者压榨异构芯片性能。交易尚未敲定,存在破裂可能

Anthropic 买的不只是世界模型,是「AI 看懂并改写物理世界」的下半场入场券。60 亿对一家估值 210 亿、还在烧钱的初创不便宜,但对比它刚签的 100 亿美元算力协议,这笔钱花在「能力拼图」而非「电费」上。问题是:世界模型至今没人跑通商业化,这更像一场为下一个五年下注的豪赌。
开 源
Nemotron 3.5 Lightning
NVIDIA 官方博客 · 本周

英伟达开源 Nemotron 3.5 Lightning:30B MoE 输出提速 4 倍

30B 总参数 / 3B 激活的 MoE 模型,OpenMDW-1.1 许可。输出速度达同类 4 倍,PinchBench 上完成 1 万任务较 Qwen3.6-35B 快 30%(86% 精度)。可在 RTX PC、DGX Spark、Jetson 本地运行。同步开源 NeMo Switchyard 智能路由库

英伟达做开源模型,本质是给自家 GPU 续命。30B 塞进消费级显卡、速度 4 倍、公开训练数据——它不需要赢 benchmark,只需要让「开源模型在英伟达卡上跑得最好」这件事成立。NeMo Switchyard 把「路由到最便宜能用的模型」变成开源基建,真正的目标是让 agent 的 token 账单,全部落在英伟达的护城河里。
前 沿 技 术

Frontier · GitHub & arXiv 周边

stablyai/orca
GitHub · 今日

orca:并行 Agent 舰队的开发环境,单日 +1,235★,总 43.9K★

TypeScript / MIT,总 43,984★。定位 ADE(Agent Development Environment),用自有模型订阅并行驱动多个编码 agent,覆盖桌面、移动、VPS,8 月 13 日仍活跃提交

43.9K 星说明一个真相:开发者要的不是「更聪明的模型」,是「管得住一群 agent」。Orca 把并行 agent 当成舰队来编排、用你自己的订阅密钥去跑——绕开了平台订阅墙,也绕开了平台的分成。当 agent 从「一个」变成「一支队伍」,编排层就成了新的操作系统。
cactus-compute/needle
GitHub · 今日

needle:14MB 端侧基础模型,单日 +315★,把 AI 塞进手机与机器人

Python / MIT,总 4,289★。14MB 基础模型,面向手机、可穿戴、智能家居与机器人,8 月 12 日活跃提交

14MB 是什么概念?一个模型的体积比一张高清图还小。needle 把「AI 必须上云」这个默认假设撕开了一道口子——手机、手表、机器人直接在本地跑基础模型,隐私和延迟问题一起消失。端侧 AI 的老大难一直是「能跑但太蠢」,needle 赌的是「够小也能够用」这条路的尽头,比想象中近。
NVIDIA-NeMo/Switchyard
GitHub · 今日

NeMo Switchyard:英伟达开源智能路由库,单日 +421★,成本砍至 1/3

Rust / Apache-2.0,单日新增 421★。按任务难度把请求路由到最匹配的模型,无需重写应用,宣称成本可降至闭源方案 1/3,与 Nemotron 3.5 Lightning 同日发布(pre-alpha)

Switchyard 的野心不在模型,在「流量」。当每家都有强模型和弱模型,谁来决定哪个请求该交给谁?英伟达把这个调度器开源,等于把「token 经济学」的地基握在自己手里。成本砍到 1/3 的承诺,本质是给「多模型混合部署」这个新常态,提前铺好水管。