VOL · 58

把今天的 AI
一杯咖啡读完

每日精选 · 一手源优先 · 看见 AI 浪潮的真实方向

2026 / 08 / 07 · 周五

大 模 型
OpenAI GPT-5.6
OpenAI 官方博客 · 12 小时前

OpenAI 升级 GPT-5.6:免费用户无限聊,事实错误率暴降 68%

GPT-5.6 Sol 事实错误较 GPT-5.5 Instant 减少 68%,Luna 减少 62% / 免费用户默认升至 GPT-5.6 Luna,下周起无限文本聊天 / Plus/Pro 获 Sol 更新 + 思考滑块调推理深度 / 免费用户新增 Think 按钮调用深度推理 / ChatGPT 周活突破 10 亿

从限流到无限,OpenAI 这一步不是降价——是直接不收钱了。10 亿周活的底牌让免费不是慈善而是护城河:用户数据回流训练、生态锁定、竞品获客成本飙升。代价是 Sol 的 Work/Codex 版本保持不变——最赚钱的产品线没动,动的是大众市场。
Grok 4.6
xAI / Arena.ai · 今日

Grok 4.6 今日发布:1.5T 参数不变,靠后训练追上 Opus 4.8

架构与 Grok 4.5 相同(1.5T MoE V9),仅改进 SFT + RL 后训练 / 前代 Grok 4.5 成本为 Opus 4.8 的 1/5 / Grok 4.7(2.1T 参数)数周后跟进 / Arena Agent 排行榜本周上线评测 / Musk 称将达 Kimi K3 与 Opus 4.8 水平

xAI 的玩法变了:不再是堆参数,而是在一个架构上反复压榨后训练。4.6 如果保持 4.5 的 $2/$6 定价而追平 Opus 4.8,最慌的不是 Anthropic——是正在签大单的企业客户,刚买的旗舰模型一个月就贬值。但 4.5 的幻觉率高达 54%,后训练能不能压住才是真考验。
融 资
钛媒体 / 财经 · 12 小时前

DeepSeek 宣布 API 整体涨价,同时低调重启 500 亿二轮融资

V4-Flash 调用量一周内升至全球第一 / API 整体提价预计涨幅较大 / 持有约 2 万张 H 系等效芯片训推共用 / 二轮融资计划募资 500 亿元,投前估值约 5000 亿元(较首轮 +43%)/ 7 月底曾因「投资者会议实录」事件暂停,现已重启

V4-Flash 正式版一周冲到全球调用量第一,然后涨价——这个顺序很梁文锋:先证明东西好用,再证明你该多付钱。2 万张卡的训推共用已经吃紧,涨价本质上是算力再分配。融资 500 亿的底气来自调用量,但投资人赌的是 V4-Pro 正式版能不能守住在 Agent 基准上的领先。
经济参考报 · 今日

可灵 AI 完成近 $30 亿融资:BAT 史上首次同台入股,投后估值 $180 亿

近 30 亿美元融资,创视频大模型单轮最大纪录 / 腾讯、阿里云、百度首次同时出现在一家公司股东名册 / 腾讯阿里各出约 ¥13.6 亿(各持股 1.1%),百度 ¥3.4 亿(0.28%),无董事会席位 / Q1 营收超 ¥6.5 亿(+300% YoY),ARR 近 $5 亿 / 近三月 AI 视频赛道四家融资合计近 ¥300 亿 / 含 IPO 对赌:2031 年 10 月前未上市可按年化 8% 单利回购

BAT 在同一个项目里当小股东——上一次可能是互联网诞生之前。三家不争控制权、只占小股,本质上是对字节跳动 Seedance 强势追击的联合防御:字节的 Seedance+剪映+TikTok 全链条太完整,三家各自攒不足视频生成能力,只能联手押可灵。IPO 对赌把窗口收窄到 5 年。
开 源
腾讯研究院 / 阿里 · 今日

阿里 Wan3.0 视频模型开启公测:单次生成 30 秒,支持一镜到底

新一代视频生成模型 Wan3.0 开启公测 / 单次可生成 30 秒视频 / 支持连续运镜、一镜到底等复杂镜头语言 / 智能时长适配 / 字节 Seedance 2.5 同期发布(同样 30 秒)/ AI 短剧制作成本已从传统 ¥30-50 万压缩至 ¥3-5 万

视频生成赛道从「能跑就行」进入了「谁能稳定产出可商用内容」的阶段。30 秒 + 一镜到底是硬指标——这意味着模型不仅要逐帧生成合理画面,还要保持镜头内物体一致性。阿里和字节几乎同时攻到这个关口,真正的胜负手不在模型,在谁能把推理成本降到让短剧公司愿意切过来。
硬 件
The Information / IT之家 · 今日

NVIDIA 拟降 Rubin Ultra 显存配置,HBM 短缺倒逼芯片「缩水」

NVIDIA 内部过去数周测试了至少 3 种低 HBM 配置的 Rubin Ultra / 原定 HBM4E 可能降至 HBM4,12Hi 降至 8Hi / 三大 DRAM 原厂 HBM4E 验证进度存在变量 / 显存缩减后运行大模型需部署更多 GPU,系统成本或进一步上升 / SK 海力士股价当日跌近 5%

NVIDIA 主动降配,暴露的不是技术问题,是整个 AI 产业的物理天花板。HBM 制造复杂、良率低、扩产慢——供需缺口已经不是涨价能解决的。对云厂商而言,Rubin Ultra 如果「缩水」意味着花更多钱买更多卡才能跑同样规模的模型,AI 基础设施成本曲线可能不是下降而是上翘。
SpaceX / 马斯克 X · 12 小时前

马斯克启动 Terafab:$168 亿 AI 芯片工厂,总投 $1190 亿

SpaceX 联合特斯拉在得州启动 Terafab 项目 / 初期投资 $168 亿,扩建后总投 $1190 亿 / 目标年产 1TW 算力 / 配套自建天然气发电厂 + 储能电池阵列 / Optimus 机器人消耗约 25% 产能,航天 AI 消耗 75% / 已与英特尔达成芯片制造合作

Terafab 的逻辑不是「造芯片卖给别人」,而是「造芯片给自己用」。Optimus 需要推理芯片、SpaceX 需要航天 AI 芯片——马斯克正在把 Tesla、SpaceX、xAI 和 Neuralink 的芯片需求从外部采购变成自给自足。$1190 亿看似疯,但如果这笔钱替代的是未来十年从 NVIDIA 进货的账单,账就好算了。
前 沿 技 术

Frontier · GitHub & arXiv 周边

loopx
GitHub · 今日

loopx:轻量级 Agent 循环工程内核,847 Stars/天,跨 Codex/Claude Code

GitHub 2.9K Stars / 今日 +847 Stars / Python / Agent-loop agnostic 跨 Codex、Claude Code、Cursor / 持久化目标管理 + 配额感知自动唤醒 + 可执行 TODO + 证据日志 + 可验证交接 / 长时程多 Agent 团队运行时

loopx 解决的问题很具体:多个 AI Agent 长时间协作时,怎么记住「做到哪了」、怎么在失败后恢复、怎么在不同 Agent 框架间传递状态。2.9K Star 不算大,但 847/day 的增速说明这个需求正在从少数人的痛点变成普遍需求——「Agent 的工程基础设施」可能是下一个大方向。
Uber ADR
GitHub · 今日

Uber 开源 ADR:企业级 AI Agent 可观测性与安全框架,已在 Uber 部署

GitHub 1.2K Stars / 今日 +289 Stars / Python / 可观测性 + 安全基准测试 + 威胁检测三位一体 / 已在 Uber 生产环境部署 / 面向企业 AI Agent 的全栈安全方案 / 安全基准测试覆盖 Agent 常见攻击面

Agent 安全终于从「讨论原则」变成了「有开源工具」。Uber 敢把它部署到生产环境再开源,说明不是实验室玩具。ADR 代表了一个趋势:Agent 大规模落地的瓶颈已经从「能不能干活」变成「干活的时候会不会闯祸」——可观测性和安全测试正在变成 Agent 基础设施的标配。
arXiv · 4 天前

MemArbiter:Agent 记忆仲裁框架,ALFWorld 成功率 92.5%,超基线 25 个百分点

arXiv 2608.02113 / 功能感知记忆仲裁框架 / 五种功能记忆库 + 焦点-环境双通道表示 + 时间呈现门控 / ALFWorld 500-token 预算成功率 82.8%,750-token 达 92.5% / 比最强基线高 20.9-25.4 个百分点 / 显著改善失败后恢复并减少重复动作

现有 Agent 框架的记忆管理基本是「把所有东西都塞进去」,MemArbiter 的贡献是证明了「知道什么时候回忆什么」比「记住一切」更重要。92.5% 在极其受限的 750 token 预算下是相当硬的数字——尽管只在 ALFWorld 上验证,但方向是对的:Agent 的记忆不是仓库,是调度系统。