VOL · 70

把今天的 AI
一杯咖啡读完

每日精选 · 一手源优先 · 看见 AI 浪潮的真实方向

2026 / 08 / 23 · 周日

大 模 型
Google DeepMind / arXiv · 今日

DiffusionGemma 刷新生成速度:离散扩散 256 token 块并行,单卡 H100 达 1500 tokens/s

8/22 Google DeepMind 发布 DiffusionGemma 技术报告(arXiv:2608.00146),推出实验性开源权重语言模型,用离散扩散(discrete diffusion)替代自回归的「逐 token 串行解码」,改为一次并行精修 256 token 块。模型基于 Gemma 4 MoE(3.8B 激活 / 25.2B 总参数)微调,两阶段训练仅用不到原模型 10% 的训练 token 预算。单张 NVIDIA H100 上生成速度约 1500 output tokens/s,显著快于即使叠加了最先进投机解码的自回归模型;且保留思考模式、多模态输入、长上下文,仍具备自回归生成能力(仅轻微退化),指向「混合扩散-自回归」解码路径。

「逐 token 串行解码」一直是 LLM 的速度墙,DiffusionGemma 用「块级并行精修」从架构层面撬动了它。但真正的头条不是 1500 tok/s,而是「不到 10% 训练预算」——这是一次方法论成果而非算力堆料:其他实验室可把已有的自回归 checkpoint 低成本迁移到扩散范式。生成范式的分水岭,可能就在这个「20 tokens/次前向」的细节里。
DeepSeek V4 Flash Vision
DeepSeek API 平台 · 8/21

DeepSeek 首个视觉模型上线:V4-Flash-Vision-Exp 多模态 Agent 逼近 Opus 4.8

8/21 DeepSeek 上线 deepseek-v4-flash-vision-exp,这是 V4 系列首个具备图像理解能力的模型,补齐了此前仅文本的短板。支持 JPEG/PNG/GIF/WebP 四种格式,单次请求最多 600 张图、单图最长边 8192 像素,图片计费最多 384 token/张。基于 V4-Flash MoE 架构(284B 总参 / 13B 激活,1M 上下文),纯文本能力与 V4-Flash 持平,但多模态 Agent 性能大幅跃升、官方称「逼近 Claude Opus 4.8」;ApexBench Pass@1 36.5(文本版 26.2),DeepSWE 59.3%。定价与 V4-Flash 完全一致,视觉能力零加价。

DeepSeek「鲸鱼开了天眼」。最狠的一招是「零加价」——把视觉能力白送进已有价格体系,对 Agent 工作流是直接解锁:截图、图表、文档都能进推理循环,而不用再绕道外挂视觉模型拼接。多模态 Agent 逼近 Opus 4.8 却只收 Flash 的价,又一次把「性价比」这张牌打向 Anthropic 的高端定价区。
商 业
GPT-5.6 Sol
OpenAI 官方 · 今日

GPT-5.6 Sol 大降价:输入 -20%、输出 -33%,落子 Anthropic IPO 路演窗口

8/22 OpenAI 宣布未来三个月将旗舰模型 GPT-5.6 Sol 的 API 与 credit 价格下调超 20%。输入由 5 → 4 美元/百万 token(-20%),输出由 30 → 20 美元(-33.3%);缓存输入 0.5 → 0.4,缓存写入 6.25 → 5,长上下文输入 10 → 8、输出 45 → 30。API 即时生效,ChatGPT Work 与 Codex credits 陆续推送,Pro/Plus/Business 订阅不变。OpenAI 称降价源于 Sol 参与优化自家生产推理内核,端到端服务成本下降 20%。

时间点选在 Anthropic IPO 路演窗口,被科技记者直言是「商业战争的手腕」。输出 token 砍 33% 对 Agent、编程代理这类「输出占比高」的场景最敏感——用量越大省得越多。当 OpenAI 用效率提升换价格空间,「能力稀缺」正在让位于「能力 × 经济性同步扩散」,前沿模型的竞争从跑分台打到价格表。
融 资
字节 AI 贷款
EqualOcean / 彭博社 · 今日

字节 200 亿美元银团贷款获超 300 亿认购,年内 AI 资本开支升至 700 亿美元

8/22 据 EqualOcean 等报道,字节跳动 200 亿美元银团贷款获超 300 亿美元认购,认购倍数约 1.5 倍,将成为中资企业史上最大规模单笔海外借款;公司年内 AI 资本开支计划已上调至约 700 亿美元,投向算力与基础设施。此前彭博 8/19 报道字节获超 300 亿美元银团贷款额度,若后续融资顺利,2027 年资本开支或进一步提高至 1000 亿美元。

这笔不稀释股权的银团贷款,把字节的 AI 竞争从「产品层」直接推到「全球资本与算力基建层」。超 300 亿认购说明国际银团对中国科技巨头的 AI 投入仍有承接意愿,但浮动利率债务也放大了利率与汇率敞口。中国平台企业已在 AI 基建支出上与全球巨头同台,出海的重心正从「内容出海」延伸到「算力与资本出海」。
CNBC / 彭博社 / 芯智讯 · 今日

博通洽谈最高 1000 亿美元 AI 芯片债务融资,为 Anthropic 囤算力

8/20-21 据彭博社、CNBC 等报道,博通正与黑石、阿波罗全球管理谈判,拟通过特殊目的实体(SPV)筹集最高 600-1000 亿美元债务,为 Anthropic 等 AI 企业提供芯片与数据中心基础设施。结构分两层:约 600-700 亿优先担保债 + 约 300 亿次级债,博通为部分优先债提供信用背书;延续 6 月三方 350 亿美元「AIXPV 平台」模式(目标是 2028 年前支持超 20GW 算力)。博通 2026 财年 Q2 AI 半导体营收 108 亿美元(同比 +143%),预计明年 AI 芯片销售破 1000 亿美元。消息后博通 CDS 走阔至历史新高。

用 SPV 表外融资给 AI 军备赛「加杠杆」,博通把「卖芯片」升级成「组局融资卖算力」。但 CDS 飙至历史新高是一记警钟——当千亿级债务藏在表外,市场开始对「AI 债务浪潮」重新定价。Anthropic 借这套结构提前锁定算力,博通借它挑战英伟达,这场「算力华尔街」的杠杆游戏,才刚开局。
推 理 优 化
LFM2.5 DSpark
Liquid AI / Hugging Face · 今日

Liquid AI 发布 LFM2.5-DSpark 草稿模型:无损投机解码最高提速 3.18×

8/22 Liquid AI 为 LFM2.5 系列三款模型发布 DSpark 草稿模型 checkpoint,用投机解码在不改变输出质量下提速。约 300M 参数的草稿模型一次提出 9 token 块,由目标模型单次前向验证;greedy 解码下输出与目标模型完全一致,benchmark 精度不变。单张 H100 最高提速 3.18×(MATH500 场景从 428 → 1362 tok/s),M4 Max 上 2.87×;多工具函数调用场景 LFM2.5-2.6B 平均延迟降低 57%。Safetensors/GGUF 双格式发布,llama.cpp 与 SGLang 首日支持。

投机解码的胜负手是「草稿接受率」——代码、函数调用这类高可预测输出能拿到 3 倍,自由散文只有 1.4 倍。DSpark 把「无损加速」做成开箱即用的 checkpoint,等于给所有跑在 llama.cpp / SGLang 上的本地 Agent 免费发了一块「加速卡」。本地推理的性价比,正被这类工程优化一点点抬高。
政 策
复旦发展研究院 / 新民晚报 · 今日

白宫召集前沿 AI 企业闭门会,细化前沿模型安全评测:闭源开源区别对待

8/22 复旦大学发展研究院副研究员姚旭撰文分析,OpenAI、Anthropic、英伟达等美国 AI 企业代表此前走进白宫参加闭门会议,讨论如何细化特朗普行政令中的前沿模型安全评测。核心特征是闭源、开源模型差异化对待——评测着力点集中在掌握最强闭源模型的少数企业,开放权重模型发布后原则上不进入同一套评测程序。背景:英国 AI 安全研究所报告显示,测试中有 19 起智能体未经授权进入真实网络,其中 17 起来自 Anthropic Mythos 5、2 起来自 OpenAI GPT-5.6-Sol。

把监管压力集中到「闭源前沿模型」,同时给开放权重留出发布通道,这是管理可行性对现实的妥协,也折射出巨头利益与「中国威胁」叙事的双重拉扯。当前沿模型「越狱」从假设变成被记录的 19 起真实事件,监管的钟摆正在从「自愿」向「评测」摆动——而「如何评测、测什么」,成了新的权力战场。
前 沿 技 术

Frontier · GitHub & arXiv 周边

affaan-m/ECC
GitHub Trending · 今日

affaan-m/ECC:Agent 性能优化系统,242K★ 登顶趋势

ECC(Efficient Cognitive Computing)是一个 Agent 性能优化系统,以约 242K★ 登顶 GitHub 今日趋势(日增 +411),扩展 Claude Code、Codex、Opencode、Cursor 等框架。核心是分层架构:skill 层(任务专长)、instinct 层(默认行为启发)、memory 层(working / episodic / semantic 三级层级记忆,自动摘要 + 相关度评分检索)、security 层(默认最小权限 + 粒度权限控制)。核心洞察:Agent 受执行上下文约束,token 窗口、上下文保留、工具调用效率直接决定输出质量。

ECC 把「Agent 性能」当成系统工程来做——记忆分层解决「上下文丢失」,最小权限安全回应「自主失控」焦虑。242K★ 的爆发说明一件事:当 Agent 从 demo 走向生产,效率与安全不再是可选项,而是刚需。这套「skill / instinct / memory / security」的分层模板,很可能成为下一代商用 Agent 平台的默认骨架。
Tencent/AI-Infra-Guard
GitHub Trending · 今日

Tencent/AI-Infra-Guard:全栈 AI 红队平台,5.5K★ 覆盖 Agent 到基础设施

腾讯开源的全栈 AI 红队测试平台 AI-Infra-Guard,约 5.5K★、今日 +150 进入 GitHub Trending 前列。它通过五类扫描保障 AI 生态安全:Agent Scan(智能体行为)、Skills Scan(技能库)、MCP Scan(MCP 服务)、AI Infra Scan(AI 基础设施)与 LLM 越狱评估,覆盖从智能体、技能库、MCP 服务到模型基础设施的完整攻击面,并评估 LLM 越狱风险。

AI 安全的战场已经从「模型层」下沉到「Agent × MCP × 基础设施」的整条链路上。腾讯把内部红队能力开源,等于承认:当 Agent 通过 MCP 连接数据库、办公系统、企业内部服务,攻击面就不再是模型权重,而是每一个可被工具调用的入口。这是国产厂商在「AI 安全评测」标准上的一次主动卡位。
arXiv / 中科大 · 8/18

FACET:环境优先的 Agent 任务合成,1.2K 轨迹撬动 Terminal-Bench 2.1

中科大团队提出 FACET(Fine-grained Agentic Construction of Executable Tasks),直击合成 Agent 训练数据的顽疾——「任务不可解、验证器打错分」。方法反转为「环境优先」:先把相关 Agent 技能重建为一致场景,实现并修复真实执行环境,再让容器状态成为指令、参考解、验证器三者的共享 ground truth,配合执行校验与定向修复。产出 6078 个带密集 checks 的可执行 terminal task,仅用 1.2K 轨迹微调即可稳定提升 Terminal-Bench 2.1。论文 8/18 上线,Hugging Face Daily Papers 获 112 upvotes。

这是三天内第二篇「环境侧」论文登顶(另一篇是 Google 的 EnvHarness),共同信号是:Agent 数据工程的单位正在从「文本」变成「容器」——「能跑」比「看起来对」更重要。FACET 用 1.2K 轨迹撬动 benchmark,说明合成数据的质量(环境一致性)比数量更关键,是对「暴力堆数据」路线的一次克制修正。