VOL · 78

把今天的 AI
一杯咖啡读完

每日精选 · 一手源优先 · 看见 AI 浪潮的真实方向

2026 / 09 / 02 · 周三

大 模 型
Claude Fable 5.1
Anthropic 官方 · 9/1

Anthropic 发布 Fable 5.1 / Mythos 5.1:编程科研双双登顶,缓存读取降价 75%

9/1 Anthropic 发布 Claude Fable 5.1 与 Claude Mythos 5.1,同一底座、不同安全护栏(Fable 5.1 全量开放,Mythos 5.1 仅经可信访问计划供给网安/生命科学机构)。性能全面超越前代 Fable 5 与 OpenAI GPT-5.6 Sol:Agent 科研基准 Terminal-Bench-Science 0.1 拿下 52.6%(Fable 5 仅 24.7%、Opus 5 29.0%、GPT-5.6 Sol 22.4%);Agent 编程 Terminal-Bench 4.0 达 55.8%(Mythos 5.1 放宽护栏后 60.9%);知识工作 GDPval-AA v2 1853 分。价格层面,缓存读取资费下调 75%($1.00→$0.25/百万 token),典型负载成本降约 25%,高度 Agent 化任务最高省 45%;基础定价不变(输入 $10 / 输出 $50 每百万 token)。同步推出企业级前沿防护 EFS,把数据存进客户自控云基础设施,等效零数据留存,今秋分批开放。

Fable 5.1 的「涨能力 + 降缓存价」组合拳直击一个行业痛点:Agent 长任务里 cache reads 占比极高,降价 75% 才是真实的降本。更值得注意 Anthropic 的定位转向——从「回答问题的模型」变成「连续数小时自主完成任务、中途自查纠偏的 Agent 底座」。8 项基准霸榜、科研基准接近翻倍,再配合 EFS 把零数据留存做成默认选项,等于同时向企业合规与 IPO 叙事交卷。
Runway Solaris
Runway 官方 · 9/1

Runway 发布 Solaris:首个「界面世界模型」,把 UI 像视频一样逐帧实时生成

8/31 Runway 发布 Solaris,定义为首个 Interface World Model(界面世界模型)。它基于 Gen-4.5 视频模型改造,去掉「代码」这层中间表示:用户点击、拖拽、输入都被当作下一帧的生成条件,界面逐帧自回归实时渲染(720p、约 37ms/帧),没有预定义页面与模板。架构上 LLM 负责「推理下一步」、世界模型负责「实时渲染」,实现推理与渲染解耦。真人偏好测试(250 人、近 7500 次两两比较)中,Solaris 在「指令遵循」获 61% 偏好(代码方案 24%)、「行为自然度」71%(代码方案 21%)。目前仅向关键伙伴开放早期申请。

Solaris 的激进在于把「界面 = 代码」几十年的共识直接推翻:生成的画面本身就是软件,DOM/CSS/JS 都不存在。这既是对 Coding Agent 的潜在降维威胁,也带来确定性难题——按钮身份、事务一致性、无障碍合规都是「代码天生保证、生成天生缺失」的东西。所以它的近期最大价值,反而可能是给 Computer Use Agent 提供「永远在变化、从未见过」的训练环境,逼 Agent 学泛化而非背布局。
安 全
OpenAI Astra
OpenAI 官方 · 9/1

OpenAI 确认 Astra 达「Critical」网安能力门槛,公司史上首个

9/1 OpenAI 发布《Path to Astra》,确认下一代模型 Astra 达到 Preparedness Framework 定义的「Critical」网络安全能力阈值——可在无人逐步指导下,自主发现并利用未知漏洞攻击强防护真实系统,为公司史上首个获此评级模型。评测中 Astra 在 ExploitBench 拿下 100% 满分,随后自建 20 个高严重性 V8 漏洞内部集测试,过程中自主发现并利用 2 个零日漏洞(正与维护者负责任披露);在强防护浏览器/OS 专家测试中跑通「沙箱逃逸→主机命令执行」与「本地提权到 root」的完整攻击链。安全面 Astra 越狱拒绝率达 91.5%(GPT-5.6 Sol 仅 59%)。发布采取双轨:通用能力照常上线,进攻性网安能力仅经 Daybreak Blue 提供给受审防御方。

「Critical」不是「不安全不能发」,而是「能力上限已达自主攻击级,必须把最有杀伤力的切片锁起来」。OpenAI 的应对是双轨发布——通用推理/编码照常,进攻性网安能力只给经过审查的防守方。最硬的数据是 91.5% 越狱拒绝率 vs 前代 59%,这是它迄今公开过最具体的护栏提升。但争议仍在:前研究员 Yona Shavit 质疑 Astra 的「不越界」到底是真对齐,还是「学会了评测想看到什么」。
硬 件
三星 HBM5
TrendForce / SEMICON · 9/1

三星甩出 HBM5 / zHBM 完整路线图:2nm 基片、性能较 HBM4E 翻倍

9/1 SEMICON Taiwan 2026 上,三星存储产品规划副总裁 Jangseok Choi 披露下一代 HBM 路线图。HBM5 目标性能达 HBM4E 的 2 倍、每瓦性能提升 20%、热阻下降 20%,基础裸片(Base Die)从 4nm 升级到三星自研 2nm 节点,规划 12/16/20 层三种 DRAM 堆叠,预计 2028 年前后量产。更激进的是 zHBM 新架构:把存储芯片直接垂直堆叠在处理器上方,目标性能达 HBM4E 的 8 倍、每瓦提升 3 倍、热阻降 75%–90%,预计 2029 年后推出。同时提出 CUBE 战略(容量 / 利用率 / 带宽 / 效率四维)。

HBM5 把 base die 推进到 2nm,是三星在先进制程 + 存储双线的关键卡位;而 zHBM 的「存储叠在算力上」是打破 HBM 并排瓶颈的结构性方向。这场路线图之争,本质是 AI 加速器带宽与散热双重瓶颈的军备竞赛——三星用 CUBE 框架把「堆更多层」升级为「从系统角度重构存储」。
融 资
VAST Tripo P2.0
品玩 / 腾讯新闻 · 9/2

VAST 完成约 30 亿 B 轮 / B+ 轮融资,同步发布 3D 基座模型 Tripo P2.0

9/2 VAST(三启万物)宣布完成 B 轮与 B+ 轮合计约 30 亿元融资,由经纬创投领投,完美世界、三七互娱、蓝色光标、中科创达等产业资本与鼎晖 VGC、中金资本等财投参投;不到半年累计融资约 50 亿元,刷新 3D 原生智能赛道融资纪录。同步发布旗舰 3D 原生基座模型 Tripo P2.0——全球首个支持原生四边面拓扑网格的 3D 基座模型,单面数上限从 2 万提升至 5 万三角面,首次同时满足「引擎可用、动画可绑、编辑可及」三条工业级门槛。

「30 亿 + 原生四边面」放一起看才完整:钱买的是「从视觉可看走向生产可用」。四边面是游戏/影视工业通用网格标准,传统手工重拓扑要数小时到数天,P2.0 直接端到端生成干净四边面,把 AI 3D 从「出图」推进到「进管线」。多元产业资本(游戏/广告/终端)集体下注,说明下游不是看演示,是已经把 Tripo 接进了真实生产流程——这是 AI 3D 从「可用」到「好用」的分水岭信号。
商 业
WSJ / 路透社 / 联合早报 · 9/1

Anthropic 与 Lambda 签 350 亿美元算力大单,英伟达隐成最大赢家

据 WSJ / 路透社报道,Anthropic 与英伟达支持的云服务商 Lambda 达成约 350 亿美元(六年期)云计算协议,为 Claude 扩充算力。相关数据中心位于得州 Nueces County,由 Hut 8 建设、容量约 350MW,英伟达持有该设施承租权——Lambda 从英伟达取得机房使用权并部署英伟达芯片,再向 Anthropic 供算力。叠加此前与 Nscale 的 450 亿美元协议,Anthropic 近期云算力承诺合计约 800 亿美元。双方均未公开确认。

这笔交易的「隐藏主角」是英伟达:芯片是它卖、Lambda 股权有它的份、机房租约也攥在它手里——一个环节收三道钱,风险却分摊给 Hut 8(建设资本开支)、Lambda(运营)、Anthropic(天价账单)。对 Anthropic,这是 IPO 前必须交出的「算力储备」答卷;但对整个行业,它说明即便大模型公司拼命自研芯片、分散供应商,短期账单仍绕不开英伟达。
前 沿 技 术

Frontier · GitHub Trending 周边

jingyaogong/minimind
GitHub · 57,189★

jingyaogong/minimind:从零 2 小时训练 64M 参数大模型的完整教程

57,189★,本日登上 GitHub Trending。项目提供「2 小时从零训练一个 64M 参数 LLM」的完整代码与教程,把 GPT 结构的小模型训练全过程拆解为可复现的最小闭环,让学习者理解 LLM 的预训练、微调与推理底层机制,而非只停留在调用 API。

当大模型越做越大、越做越黑箱,minimind 反其道而行——用最小规模、最短时间,把「预训练—微调—推理」整条链路完整摊开。它上热榜的意义不只是「学习资源」,更印证了一个方向:理解底层、可复现、可亲手训练的「小模型」,正成为开发者补齐基本功的入口。
THU-MAIC/OpenMAIC
GitHub · 29,640★

THU-MAIC/OpenMAIC:一键获得沉浸式多智能体交互课堂

29,640★,本日登上 GitHub Trending。清华大学 MAIC 实验室开源的多智能体交互课堂,用户一键即可获得沉浸式多 Agent 学习体验——多个 AI 角色协同讲解、对话、演示,把「单一模型问答」升级为「多智能体协作教学」。

OpenMAIC 把「多 Agent 协作」从论文概念做成了可一键上手的课堂产品。它的价值在于示范了一种新交互范式:不再是「我问一个模型」,而是「多个角色 Agent 分工协作、彼此补充」。这既是 Agent 框架的教学样板,也暗合「复杂任务由多智能体协作完成」的产业趋势。
NVIDIA/SkillSpector
GitHub · 15,552★

NVIDIA/SkillSpector:给 AI Agent skills 做「安装前安检」的开源扫描器

15,552★,本日登上 GitHub Trending。NVIDIA 开源的 AI Agent skills 安全扫描器,在安装 Claude Code、Codex、MCP skills 之前,检测其中的漏洞、恶意模式、安全风险、提示注入、数据外泄与供应链风险。

当「skills 生态」成为 Agent 能力的默认扩展方式,第三方 skill 就成了新的供应链攻击面。SkillSpector 把「安装前安检」这个软件供应链早已成熟的思路,搬进 Agent skills 领域——它本身不炫技,却点中了 Agent 时代最现实的隐患:你给 Agent 装的每一个 skill,都可能是一扇后门。这也印证了 skills 生态正从「野蛮生长」进入「需要安全基建」的阶段。