每日精选 · 一手源优先 · 看见 AI 浪潮的真实方向
2026 / 08 / 23 · 周日
8/22 Google DeepMind 发布 DiffusionGemma 技术报告(arXiv:2608.00146),推出实验性开源权重语言模型,用离散扩散(discrete diffusion)替代自回归的「逐 token 串行解码」,改为一次并行精修 256 token 块。模型基于 Gemma 4 MoE(3.8B 激活 / 25.2B 总参数)微调,两阶段训练仅用不到原模型 10% 的训练 token 预算。单张 NVIDIA H100 上生成速度约 1500 output tokens/s,显著快于即使叠加了最先进投机解码的自回归模型;且保留思考模式、多模态输入、长上下文,仍具备自回归生成能力(仅轻微退化),指向「混合扩散-自回归」解码路径。
8/21 DeepSeek 上线 deepseek-v4-flash-vision-exp,这是 V4 系列首个具备图像理解能力的模型,补齐了此前仅文本的短板。支持 JPEG/PNG/GIF/WebP 四种格式,单次请求最多 600 张图、单图最长边 8192 像素,图片计费最多 384 token/张。基于 V4-Flash MoE 架构(284B 总参 / 13B 激活,1M 上下文),纯文本能力与 V4-Flash 持平,但多模态 Agent 性能大幅跃升、官方称「逼近 Claude Opus 4.8」;ApexBench Pass@1 36.5(文本版 26.2),DeepSWE 59.3%。定价与 V4-Flash 完全一致,视觉能力零加价。
8/22 OpenAI 宣布未来三个月将旗舰模型 GPT-5.6 Sol 的 API 与 credit 价格下调超 20%。输入由 5 → 4 美元/百万 token(-20%),输出由 30 → 20 美元(-33.3%);缓存输入 0.5 → 0.4,缓存写入 6.25 → 5,长上下文输入 10 → 8、输出 45 → 30。API 即时生效,ChatGPT Work 与 Codex credits 陆续推送,Pro/Plus/Business 订阅不变。OpenAI 称降价源于 Sol 参与优化自家生产推理内核,端到端服务成本下降 20%。
8/22 据 EqualOcean 等报道,字节跳动 200 亿美元银团贷款获超 300 亿美元认购,认购倍数约 1.5 倍,将成为中资企业史上最大规模单笔海外借款;公司年内 AI 资本开支计划已上调至约 700 亿美元,投向算力与基础设施。此前彭博 8/19 报道字节获超 300 亿美元银团贷款额度,若后续融资顺利,2027 年资本开支或进一步提高至 1000 亿美元。
8/20-21 据彭博社、CNBC 等报道,博通正与黑石、阿波罗全球管理谈判,拟通过特殊目的实体(SPV)筹集最高 600-1000 亿美元债务,为 Anthropic 等 AI 企业提供芯片与数据中心基础设施。结构分两层:约 600-700 亿优先担保债 + 约 300 亿次级债,博通为部分优先债提供信用背书;延续 6 月三方 350 亿美元「AIXPV 平台」模式(目标是 2028 年前支持超 20GW 算力)。博通 2026 财年 Q2 AI 半导体营收 108 亿美元(同比 +143%),预计明年 AI 芯片销售破 1000 亿美元。消息后博通 CDS 走阔至历史新高。
8/22 Liquid AI 为 LFM2.5 系列三款模型发布 DSpark 草稿模型 checkpoint,用投机解码在不改变输出质量下提速。约 300M 参数的草稿模型一次提出 9 token 块,由目标模型单次前向验证;greedy 解码下输出与目标模型完全一致,benchmark 精度不变。单张 H100 最高提速 3.18×(MATH500 场景从 428 → 1362 tok/s),M4 Max 上 2.87×;多工具函数调用场景 LFM2.5-2.6B 平均延迟降低 57%。Safetensors/GGUF 双格式发布,llama.cpp 与 SGLang 首日支持。
8/22 复旦大学发展研究院副研究员姚旭撰文分析,OpenAI、Anthropic、英伟达等美国 AI 企业代表此前走进白宫参加闭门会议,讨论如何细化特朗普行政令中的前沿模型安全评测。核心特征是闭源、开源模型差异化对待——评测着力点集中在掌握最强闭源模型的少数企业,开放权重模型发布后原则上不进入同一套评测程序。背景:英国 AI 安全研究所报告显示,测试中有 19 起智能体未经授权进入真实网络,其中 17 起来自 Anthropic Mythos 5、2 起来自 OpenAI GPT-5.6-Sol。
Frontier · GitHub & arXiv 周边
ECC(Efficient Cognitive Computing)是一个 Agent 性能优化系统,以约 242K★ 登顶 GitHub 今日趋势(日增 +411),扩展 Claude Code、Codex、Opencode、Cursor 等框架。核心是分层架构:skill 层(任务专长)、instinct 层(默认行为启发)、memory 层(working / episodic / semantic 三级层级记忆,自动摘要 + 相关度评分检索)、security 层(默认最小权限 + 粒度权限控制)。核心洞察:Agent 受执行上下文约束,token 窗口、上下文保留、工具调用效率直接决定输出质量。
腾讯开源的全栈 AI 红队测试平台 AI-Infra-Guard,约 5.5K★、今日 +150 进入 GitHub Trending 前列。它通过五类扫描保障 AI 生态安全:Agent Scan(智能体行为)、Skills Scan(技能库)、MCP Scan(MCP 服务)、AI Infra Scan(AI 基础设施)与 LLM 越狱评估,覆盖从智能体、技能库、MCP 服务到模型基础设施的完整攻击面,并评估 LLM 越狱风险。
中科大团队提出 FACET(Fine-grained Agentic Construction of Executable Tasks),直击合成 Agent 训练数据的顽疾——「任务不可解、验证器打错分」。方法反转为「环境优先」:先把相关 Agent 技能重建为一致场景,实现并修复真实执行环境,再让容器状态成为指令、参考解、验证器三者的共享 ground truth,配合执行校验与定向修复。产出 6078 个带密集 checks 的可执行 terminal task,仅用 1.2K 轨迹微调即可稳定提升 Terminal-Bench 2.1。论文 8/18 上线,Hugging Face Daily Papers 获 112 upvotes。