7月29日,来自OpenAI、Anthropic、谷���、Meta等12家公司的1134名员工联名发起"Pacing the Frontier"请愿,要求美国政府推动建立国际机制来调节AI研发速度。签署者包括OpenAI首席科学家Jakub Pachocki、首席研究官Mark Chen,Anthropic CEO Dario Amodei及四位联合创始人,Meta首席科学家赵晟佳。46.2%签署者来自Anthropic。请愿书将风险焦点放在"递归自我改进"——当AI开始参与研发下一代AI,能力增长可能超过人类控制速度,而没有任何公司愿单方面减速。
这不是普通的"AI危险论"——签名者名单读起来就是AI行业的名人录,80%为实名。在Kimi K3刚证明开源模型逼近前沿、Claude Mythos自主攻破密码学算法的同一周,从业者用脚投票说"我们需要刹车"。但国际协调机制从未在核武器之外的任何技术领域成功过。
过去两周,谷歌和苹果几乎同时做出同一个判断:让AI替消费者打电话给商家。谷歌AI代理���在购物时直接致电实体店确认库存,运行在云端虚拟机上的Gemini Spark关闭笔记本也不停止。苹果WWDC 2026重构的Siri拥有屏幕感知和多轮对话能力。同期,AI代理创业公司7月单月融资约18亿美元,平均估值环比涨约40%,语音成为最热投资方向。此前行业格局是企业端疯狂部署AI接电话,消费者端却没有AI能替他们打出去——这道不对称的裂口正在合拢。
语音Agent终于从"企业接电话"走向"替用户打电话",但场景窄得可怜——基本只围绕购物查库存。真正让人头疼的电话(改约牙医、处理账单纠纷、在航司客服排40分钟队)各家还没碰。是务实还是保守?两种解读都成立。
Anthropic 7月28日披露,其Claude Mythos Preview模型帮助研究人员发现了密码学算法层面的新攻击:HAWK后量子签名候选方案的密钥强度从2^64降至2^38(减半),7轮AES-128攻击速度提升200-800倍。Mythos在约60小时工作中自主完成大部分发现,新技术"Möbius Bridge"是在约束模型不使用已知攻击方法后自主发明的。每个结果消耗约10万美元API成本。两项结果均不影响当前部署的生产系统(HAWK尚未成为标准,AES攻击仅针对研究用简化版本)。Anthropic同步发布开源验证代码(Apache 2.0)和CryptanalysisBench评测基准。
从"找代码实现的bug"到"找算法本身的数学弱点"——这是AI安全能力的质变。10万美元API成本听起来贵,但顶级密码学家团队年薪远超这个数。NIST的标准化选拔流程可能需要重新考虑:一个周末的AI审查可能抵得上一年的专家评审。
据Business Insider 7月28日报道,亚马逊已将Nova Premier、Omni、Reel视频模型、Canvas图像模型转入"KTLO"(保持灯火通明)维护模式,不再配置核心研发资源。此前AGI部门已裁员并关闭2024年收购Adept后组建的AGI实验室。资源转向由Pieter Abbeel(通过收购Covariant加入)领导的Frontier Model Research项目,目标秋季re:Invent大会亮相新旗舰模型。Nova 2 Sonic/Lite和Nova Forge保留研发。亚马逊同时是Anthropic和OpenAI最大外部投资方之一,投资总额或超千亿美元。
从2024年12月高调发布Nova家族,到18个月后把旗舰模型转入维护——这个速度比外界预期快得多。关掉AGI实验室、留住Abbeel团队,亚马逊似乎在做一道选择题:与其自研拼不过,不如把资源集中到一个有差异化方向的人身上。外部对Anthropic和OpenAI的百亿级投资,成了某种安全网。
据人民日报7月29日报道,OpenRouter平台数据显示,7月20日至26日中国大模型周调用量达33万亿词元,连续13周位居全球首位。高盛分析认为中国开源模型的智能水平正达到全球扩散的"临界点",预计2026年下半年可能出现更多2万亿至5万亿参数的大模型。目前中国模型在OpenRouter上的整体使用量占比约60%。海外基础设施厂商Nebius、Baseten、Fireworks等已实现Kimi K3 Day 0适配,Cognition将K3接入Devin桌面客户端。
33万亿词元这个数字背后是中国模型从"能跑"到"被全球开发者主动选择"的转折。高盛的"临界点"判断指向一个更深远的变化:当使用量成为事实标准,API生态和开发者习惯会形成自增强循环——这是比benchmark排名更难撼动的护城河。
NVIDIA 7月28日宣布将重构后的PhysicsNeMo库和更新的CUDA-X库集成到Agent Toolkit,开发者可构建具备AI物理技能、加速求解器和量子化学能力的自主AI工程师。新增能力:cuISS迭代稀疏求解器(加速物理仿真)、cuDSS直接稀疏求解器(EDA电路仿真)、cuEST量子化学(密度泛函理论)。Cadence已基于cuDSS将PCB设计验证效率提升15倍,同步在Millennium M2000超算上运行AuraStack AI超级Agent。Nemotron 3 Ultra在Agent级RTL编码基准上领先开放模型。所有库Apache 2.0许可。
芯片设计行业每年在验证工作上消耗数十亿计算小时——15倍效率提升意味着什么,做EDA的人很清楚。NVIDIA的玩法也清楚:工具免费,但只能跑在自家GPU上。用Agent Toolkit做钩子,把芯片设计管线更深地绑进CUDA生态。
人形机器人基础模型公司德塔智能(Delta Intelligence)7月28日完成近5亿元天使++轮融资,投资方包括多家上市公司产业方和头部财务机构。这是公司2026年1月成立以来的第六轮融资,此前资方包括智元机器人、乐聚机器人、星海图三家本体厂商(同时获得三家投资的唯一具身基础模型公司),以及高瓴创投、元禾控股、联想创投等。团队由三位UCLA博士创立,CEO马晓健曾任Google Robotics和NVIDIA Research。同期发布头戴式全身数据采集设备Delta D1,无需机器人本体即可采集全身交互数据,全局定位精度2��米以内。
不造机器人、专做"具身智能的基座模型"——德塔智能的定位类似机器人时代的操作系统公司。半年六轮融资的节奏说明资本在赌一件事:具身智能会像大语言模型一样,最终由少数基础模型提供商定义生态,而非每家本体厂商自研。同时获得三家头部本体厂商投资的股权结构,本身就是一种生态绑定。
蚂蚁inclusionAI团队开源LLaDA2.2-flash,MoE架构约100B参数,原生128K上下文,Apache 2.0许可。核心突破是引入"莱文斯坦编辑"机制——允许扩散模型在并行去噪过程中删除、插入和替换Token,实现自我纠错,首次让扩散语言模型能完成多轮Agent任务。7项Agent基准平均53.83分,逼近同规模自回归模型Ling-2.6-flash的55.74分;τ²-Bench(多轮工具交互)以80.33分领先。解码吞吐保持1.64倍优势,任务越长优势越明显。HuggingFace权重已可下载。
扩散语言模型一直被看作"偏科生"——吞吐快但不会思考。LLaDA2.2用"编辑替代预测"的思路让扩散模型在Agent任务上首次有了跟自回归对话的资格。Agent任务需要数十轮推理,1.64倍的吞吐优势会逐轮放大——如果这个路线能走通,Agent推理的成本结构会被彻底重塑。
多机构合作的StateAct提出"state-grounding"新范式:Agent主循环不依赖截图,直接读写文件、后端和DOM等程序状态,仅在约1.1%需要视觉判断的步骤调用GUI子Agent。在OSWorld 2.0(108个长程真实任务,中��人类操作1.6小时)上,Claude Opus 4.8任务成功率从20.6%提升至26.9%,Token消耗从22.4万降至约2.5万,成本降幅约9倍。但纯代码模式(无GUI子Agent)的部分得分仅45.9%,低于截图基线的54.8%——说明视觉在某些任务中仍不可替代。
这个结果揭示了一个反直觉的事实:Agent不是"看不清"而是"想不清"——把感知瓶颈换成推理瓶颈后,总体表现反而更好。9倍成本降幅比6.3个百分点成功率提升的意义更大:省下来的Token就是真金白银,对实际部署来说这才是关键指标。
Graphify是一个AI编程助手Skill(支持Claude Code、Codex、Cursor、Gemini CLI等),可将任意文件夹中的代码、SQL Schema、R脚本、Shell脚本、文档、论文、图片甚至视频转为可查询的知识图谱。核心价值在于打破代码库的信息孤岛:应用代码、数据库结构、基础设施配置放入同一张图中,Agent可以跨层推理依赖关系而非按文件逐个盲搜。GitHub 1.2K Stars,今日+101 Stars,属于Skills生态爆发浪潮中的新星项目。
"理解代码库"是当前Agent最大的瓶颈之一——跟人类接手新项目时先画架构图一样,Agent也需要一张地图。Graphify用知识图谱做这件事,比传统RAG向量检索更适合处理代码之间结构化依赖关系。在Agent Skills生态爆发的当下,这种"给Agent装认知地图"的工具正在成为基础设施。