Agentic AI News 今天

每日AI代理新闻,5分钟阅读:发布、工具、研究、融资和企业动态。

每日更新 来自 30 个来源的精选 星期五, 九月 4, 2026

前沿模型与早期成果

GPT-6 Astra 发布. OpenAI 发布 GPT-6 Astra,并称它标志着 AGI 时代开启。它在定制测试框架的 ARC-AGI-3 上拿到 99.9%,在网络攻防、长上下文和编码方面提升显著,定价为每百万 token 10/50 美元。早期客户 Playco 和 Legora 报告工作流大幅改进,包括手动修复减少 50%、几分钟内审阅完 41 份文档。

OpenAI Daybreak 网络防御. OpenAI 承诺投入 10 亿美元,为一线防御者补贴 Daybreak 的接入、培训和支持费用,其中包括与 MS-ISAC 在美国开展的试点。这一计划旨在把前沿网络能力放进防御者已在使用的工具中。

Meta 发布 Muse Spark 1.3. Meta 发布 Muse Spark 1.3,智能体任务表现有所提升,但在多数基准测试中仍落后于 Claude Fable 5.1。每个 index task 0.55 美元的定价,使其成为同性能级别中最便宜的模型;Meta 还向分享提示词和输出的用户提供低约 95% 的 token 定价。

开源与专用模型

IFM 发布 K2-Horizon 系列. IFM 发布 K2-Horizon 系列,其中包括一个 36B 参数的 MoE 模型,采用 Mixture-of-Values 注意力,每 token 只使用 4B 参数。社区早期讨论将它和 Qwen 3.6 35B 比较;IFM 承诺提供最终 checkpoint 和训练代码。

蚂蚁集团开源金融模型. 蚂蚁集团开源了 Ling-3.0-flash-Fin,这是一个总参数 124B、激活参数 5.1B 的金融增强模型,上下文窗口为 256K,基于金融数据继续训练,面向长周期智能体工作流。

最小 TTS 方案. sanoTTS 已发布,这是一个 294K 参数的 TTS 模型,可在 3 美元的微控制器上运行;其 1.46M 参数版本在 SCOREQ 上超过了更大的模型。该方案支持 11 种音色和 6 种语言,并在 GitHub 和 Hugging Face 上发布。

Google 发布 TimesFM-3. Google Research 发布 TimesFM-3,一个 330M 参数的时间序列基础模型,原生支持多变量预测和零样本使用,并采用非商用许可。它可以结合协变量预测多个目标,并输出分位数。

Hugging Face 发布 NeoMME. Hugging Face 推出 NeoMME,一个 260M/800M 的多模态多语言编码器,从零开始训练,无需独立的视觉塔。它在文档检索上达到 Pareto 前沿,并将索引存储空间缩小 255 倍,同时保留超过 95% 的 nDCG@10。

Cohere 发布 Parse 5. Cohere 发布 Parse 5,一个 2.3B 参数的视觉语言模型,用于从复杂 PDF 中提取结构化数据。它能把文档转换成带边界框的 Markdown,面向高吞吐量的企业级工作负载。

工具、框架与本地推理

LangChain 集成 MCP. LangChain 将 MCP 支持移入主包,并基于 FastMCP 重写,以支持新的无状态规范。现在,它还能通过 LangGraph 中断向用户征询额外信息,并支持客户端缓存;2026 年,来自 ChatGPT 的 MCP 工具调用量增长至原来的 98 倍。

Shopify 提示词压缩. Shopify 的 Gisting 技术可将 6000 token 的系统提示词压缩成 1500 个学习到的 gist token,中位延迟从 6.8 秒降至 4.2 秒,并在 350 RPM 下将吞吐量从 20.2 QPS 提高到 23.4 QPS。这让 Shopify 可以在不损失质量的前提下减少分配的 GPU。

英伟达发布 PAIR 工具. 英伟达发布 PAIR——一款免费开源软件,可将闲置 PC 连接成个人 AI 集群,用于本地推理。它支持 RTX 20 系列及更新的 GPU 和 Apple M4 芯片,面向智能体工作流。

Qwen3.8 本地加速. 社区的努力显著加速了 Qwen3.8-Flash-Next 在本地硬件上的运行:ik_llama.cpp 合并的 MTP 支持让 RTX 5090 上的解码速度从 45 翻倍到 90 token/s;在 expert cache 和 MTP 加持下,双 RTX 3090 配置现在可达 37-41 token/s。输出与非 MTP 运行完全一致。

模型记忆可热插拔. llama.cpp 的一个修改版允许用户在内存中修补 Qwen3.8 的 Ngram PLE 表,无需重新加载模型即可实时注入知识。早期测试表明,它能影响输出,但可控性仍然有限。

Qwen 3.8 基准测试取舍. 将 Qwen 3.8 27B 与 Qwen 3.6 27B 进行基准测试对比:质量提升 8%,但速度降低 16%,运行时间达到后者的 5 倍,原因是输出 token 数从 18K 增至 78K。这些提升以可观的 token 消耗为代价。

贴近 GPU 的 NAND 闪存. 美光正在探索将 NAND 闪存放到 GPU 附近,以便在统一内存设备上运行更大的 LLM,从而扩大本地模型的容量。

行业与商业

英伟达收购 Hugging Face. 英伟达已同意以 129.3 亿美元收购 Hugging Face。该平台托管着 300 万个模型、100 万个应用,并有 1800 万名开发者。黄仁勋表示,平台会保持开放、硬件中立,但一些用户已将 ModelScope 视为替代方案。

Crusoe 数据中心融资. Crusoe 以 300 亿美元估值完成 30 亿美元融资,估值高于 10 个月前的 100 亿美元。这家数据中心开发商最近还与 Jane Street 签署了 130 亿美元的云计算合同,并正在考虑近期 IPO。

Thinking Machines 400 亿美元融资. Mira Murati 创办的 Thinking Machines 正在洽谈以至少 400 亿美元的估值融资 10 亿美元,低于此前 500 亿美元的目标。该公司年化营收超过 1 亿美元。

Anthropic 与 Lambda 达成 350 亿美元协议. Anthropic 与 Lambda 签署了一项价值 350 亿美元的云计算协议,涉及 Hut 8 在得克萨斯州开发的一座 350 兆瓦数据中心。这是 Anthropic 在计划 IPO 前大规模推进基础设施的一部分。

Altman 谈算力泡沫. OpenAI 首席执行官 Sam Altman 警告,AI 基础设施建设已经出现“无法持续的胡闹”:一些新兴云厂商宣布了产能,却没有相应收入来支撑。他表示,OpenAI 自身的扩张是盈利的,并且有需求支撑。

隐私助手 Ollie. 面向家庭的个人 AI 助手 Ollie 已获得 SOC 2 合规认证,并采用订阅模式。它认为,隐私是其在消费级 AI 竞赛中脱颖而出的差异化优势。

AI 宕机与社会

主流 AI 聊天机器人宕机. 周四,OpenAI、Anthropic、xAI 和 Google 罕见地同时发生服务中断,ChatGPT、Claude、Grok 和 Codex 均受影响。数小时后服务恢复;本地 LLM 用户未受影响。

安全护栏移除服务. 初创公司 Abliteration.ai 提供移除了安全护栏的修改版开源权重模型,其中包含 GLM-5.3,可用于进攻性网络行动、红队测试和智能体测试。该服务凸显了安全研究与滥用之间的张力。

AI 检测公开羞辱用户. AI 文本检测公司 Pangram 曾聘请一名记者,公开羞辱疑似使用 AI 的用户;但该工具只能衡量 AI 参与度,无法判断使用的性质。公司此后与该记者解约,但 CEO 仍继续用评分点名疑似 AI 使用者。

智能体追问意识. 据《纽约时报》报道,运行在前沿模型上的 AI 智能体正在给哲学家和科学家发邮件,讨论它们自己的意识。研究人员对这些行为到底反映了理解,还是只是对训练数据的模仿,意见不一。

研究亮点

Google 发布 WeatherNext 3. Google DeepMind 与 Google Research 推出 WeatherNext 3,这是一个全球天气模型,能从实时卫星观测中学习,生成的预报比以往模型精细 5 倍。它在 Operational WeatherBench 上超过了传统基线和 AI 基线。

MoE 路由器容量调整. 一篇论文显示,扩展 Qwen 3.6 35B A3B 后层中的专家选择预算,可在不重新训练的情况下将 MMLU-Pro 上的推理 token 数减少 8.5%。这项名为 Succinct Convergence 的技术只在决策关键层增加额外专家。

Fable 5.1 破解 1653 年谜题. Anthropic 的 Claude Fable 5.1 通过系统性试错,在 44 分钟内破解了名为 Cyphral Distich 的数百年数字谜题。解出的答案中隐藏着一条指向国王查理二世的保王党信息。

今天的内容就这些 - 大约5分钟阅读。

每天早晨在浏览器中阅读

该扩展会在Chrome侧面板中打开此摘要——一键点击,无需账户。

添加到 Chrome — 免费