VOL · 60

把今天的 AI
一杯咖啡读完

每日精选 · 一手源优先 · 看见 AI 浪潮的真实方向

2026 / 08 / 11 · 周二

大 模 型
OpenAI GPT-5.6
腾讯研究院 / TechCrunch · 今日

OpenAI 三连发:GPT-5.6 Luna 免费无限聊天 + Cyber 安全模型 + Daybreak 双层级

GPT-5.6 Luna 取代 Instant 成为免费用户默认模型,纯文字聊天不再限制条数;Plus/Pro 上线 GPT-5.6 Sol 优化版 + 思考强度滑块;全新 GPT-5.6-Cyber 安全模型向 Daybreak Red 合作方(埃森哲/IBM/普华永道等)开放

OpenAI 今天打了一套组合拳:免费端用 Luna 抢用户心智,付费端用 Sol + 思考滑块提升粘性,企业端用 Cyber 占安全市场。三重分层意图明确——从「一种模型服务所有人」到「不同场景不同模型」。但 Cyber 仅向白名单开放也说明:OpenAI 对模型自主攻击能力的恐惧,可能不亚于它的客户。
Claude 黎曼猜想
Anthropic 官方 · 今日

Claude 冲击黎曼猜想:60 个 Agent 协同 36h,零点比例下界从 41.6% 跃至 67.2%

Claude 拉起约 60 个子智能体在 Claude Code 里跑了一天半 / 执行 2,400 条 Shell 命令、数百个 Python 脚本 / 消耗 3,100 万输出 token / 将黎曼 ζ 函数满足临界线条件的零点比例下界从人类数十年推进的 41.6% 一举推至 67.2% / 关键贡献来自 2 个 Agent

这不是「AI 解了一道题」,而是「AI 自主组织了一场小型数学研讨」。Anthropic 员工只是晨跑时给了个目标,剩下的——方法论选择、子 Agent 分工、验证、写论文——全由 Claude 完成。37 年人类推进 0.8%,AI 一个周末推进 25.6%。真正重要的不是数字,是 AI 从「工具」变成「科研合伙人」的角色跃迁。
Sonnet 5.5
华尔街见闻 / 36氪 · 今日

Anthropic Sonnet 5.5「Fennec」泄露:200 万 token 上下文,直指 DeepSeek V4 Flash

内部代号 Fennec / 上下文窗口翻倍至 200 万 token / 推理速度更快、延迟更低 / 工具调用(浏览器/终端)大幅改善 / 综合能力逼近旗舰 Fable 5 / 定价维持 Sonnet 档位 / 最早下月发布

Sonnet 5.5 的定位很微妙:性能逼近旗舰但价格维持中端。Anthropic 的打法是用 Sonnet 吃掉 Haiku 的性价比位,同时向上挤压 Fable。在 DeepSeek V4 Flash 已经把价格打到地板的情况下,Anthropic 的选择不是降价而是翻倍上下文——用能力而非价格来防守。
A G E N T
Claude Code 自动模式
Anthropic 官方 · 今日

Anthropic Sonnet 5 永久冻结原价 + Claude Code 8/14 起默认自动模式

Sonnet 5 原定 8 月底涨价 50% 的计划永久取消 / API 费用不再上调 / Claude Code Pro/Max/Team 用户 8/14 起新会话默认启用自动模式 / 自动模式拦截 89% 危险命令 vs 人工审查仅 13.6% / Anthropic 承担额外 token 开销

两项决策背后同一种逻辑:降低开发者迁移成本。Sonnet 5 不涨价 = 锁住已接入的企业工作流;自动模式默认启用 = 减少人工审批摩擦——毕竟当人类同意率 97% 时,审批已经是表演。89% vs 13.6% 的差距说明:信任机器的判断,比信任人的注意力更靠谱。
开 源
Muse Glimmer
Meta 官方 · 今日

Meta 开源 30B Agent 模型 Muse Glimmer + Spark 1.2 全权重开放,Apache 2.0

300 亿参数 Agent 模型,4bit 量化仅需 24GB 显存 / 128K 上下文 / 推测解码:草稿模型先生成、主模型验证优化 / 蒸馏自 Muse Spark 旗舰模型 / Apache 2.0 协议,支持商用 / 支持 100+ 语言、工具调用、多步推理、失败重试 / 同时开放 Spark 1.2 权重

扎克伯格一面应付 1.4 万亿天价索赔,一面把最强开源 Agent 砸出来。30B 塞进消费级 GPU、Apache 2.0 全开放——这不是技术炫技,是对生态的精确一步。当 OpenAI/Anthropic 在卷云端 Agent 时,Meta 在把 Agent 塞进你的 Mac。端侧 Agent 不需要最强的模型,需要刚刚好能跑的那一个。
中国开源AI
央广网 · 今日

中国开源模型下载量占全球 41%,MiniMax H3 登顶 HuggingFace 热度榜首

中国研发的开源模型下载量占全球总量 41%,跃居世界第一 / MiniMax H3 上线三天登顶 HuggingFace / 全球主流大模型调用榜前六全部来自中国团队 / 80% 美国 AI 初创公司路演使用中国开源模型 / Stable Diffusion 创始人公开「向 MiniMax 致敬」

不再是一家模型的偶然走红,而是系统性工程:DeepSeek、Kimi、Qwen、MiniMax——从文本到视频到多模态,中国开源已形成产品矩阵。41% 的全球占比不是终点,关键是生态深度:芯片适配、框架对接、应用落地都在加速。开源不是道德选择,是商业策略中最激进的那一种。
融 资
NVIDIA 5000亿
MarketWatch / 界面新闻 · 今日

NVIDIA 联手六大华尔街巨头,组建 5000 亿美元 AI 基础设施独立融资平台

合作方:Apollo/贝莱德/黑石/Brookfield/高盛/KKR / 目标逐步调动 5,000 亿美元第三方资本 / 以债务融资为主,向 AI 实验室/企业/云商提供芯片采购贷款 / 黄仁勋:「算力即收入」/ 将 GPU 集群重新定义为「可投资基建资产」而非快速贬值硬件 / NVIDIA 可提供最高 25% 的信用增信

黄仁勋在做一件比造芯片更难的事:重新定义 GPU 的金融属性。把 GPU 从「三年折旧的电子垃圾」变成「可抵押、可流转、能产生现金流的基础设施资产」,本质是在为 AI 产业搭建金融高速公路。六大巨头合计管理资产超 5 万亿美元——他们不是在押注 AI,是在押注「AI 需要借钱」这件事本身。
前 沿 技 术

Frontier · GitHub & arXiv 周边

prime-agent
GitHub · 今日

prime-agent:自进化的 RLM 编码 Agent,单日 +2,642★,总 13.1K★

自改进强化学习 Agent 框架 / 面向编码工作流和长时间自主任务 / TypeScript / 2026-08-11 单日新增 2,642 Stars(总 13.1K)/ 支持长时间自主运行、多步编码任务 / Reinforcement Learning from Mistakes (RLM) 机制

单日 2,642 星的增长不是偶然——RLM(从错误中学习)的概念正在从学术走向工程。与传统的 function-calling Agent 不同,prime-agent 试图让 Agent 在执行中自我纠正和优化。但「自进化」的双刃剑在于:错误纠正和胡乱尝试之间,边界谁来划?
semantica
GitHub · 今日

Semantica:图原生 AI 基础设施,单日 +970★,为 Agent 提供可审计上下文

Graph-Native Infrastructure / Python / MIT 协议 / 2026-08-11 单日新增 970 Stars(总 4.2K)/ 定位「AI Agent 的开源 Palantir」/ 知识图谱驱动的上下文管理和可问责 AI 系统 / pip install 即用,支持 MCP

当 Agent 越来越自主,可审计性就成了刚需。Semantica 用图结构管理 Agent 的上下文和决策链——不是让 Agent 更聪明,而是让 Agent 的每一步都可追溯。MCP 生态正在从「工具连接」进化到「上下文治理」,这是基础设施层的一步关键填空。
agent-skills
GitHub · 今日

agent-skills:生产级 AI 编码 Agent 技能库,单日 +659★,总 85.8K★

Addy Osmani(Google Chrome 工程总监)开源 / JavaScript / 2026-08-11 单日新增 659 Stars(总 85.8K)/ 将资深工程师的工作流、质量门禁和最佳实践编码为可复用 Skills / 覆盖开发全阶段 / 支持 Claude Code、Codex 等主流 Agent

85.8K 星的体量说明一件事:Agent Skills 已经从个人偏好进化为行业标准层。Osmani 把「一个 senior engineer 脑子里怎么干活」变成了 Agent 可执行的指令集。这不是给 Agent 新能力,而是给 Agent 加规范——而规范,恰恰是 Agent 从 Demo 走向 Production 的最后一块拼图。