Agentic AI News 今天

每日AI代理新闻,5分钟阅读:发布、工具、研究、融资和企业动态。

每日更新 来自 30 个来源的精选 截至八月 23, 2026的一周

开放模型与本地推理

Qwen 3.8 27B. 阿里巴巴基于 Apache-2 许可证的 Qwen 3.8 27B 可在高端笔记本和本地 GPU 上运行,xhigh 推理模式表现强劲但有过度思考倾向。社区优化使其在 RTX 3090 上达到 381 tokens/秒,量化版本可在 16GB 显存中运行。35B MoE 不会发布,但预计下周会有新的中等规模开放权重模型。

GLM-5.3 开放模型. 智谱发布 GLM-5.3,改进完全来自更多后训练,复杂编码和长时程任务表现更佳。该模型在开放模型排行中与 Kimi K3 并列第一,智能体能力大幅提升且成本更低,但开放权重将推迟两周。

智能体基础设施与工具

Cursor 推出 Origin. Cursor 推出了 Origin,这是一个对标 GitHub 的代码托管服务,具备原生智能体功能,并计划打造应用生态系统。这标志着编程智能体厂商正进入开发者平台层。

Cloudflare WriteGuard. Cloudflare 的 WriteGuard 现已进入内测阶段,可为通过 MCP 服务器执行的写入操作提供集中策略、归属和审计日志。它解决了企业部署中的智能体工具调用治理问题。

商业与交易

Anthropic 营收领先. Anthropic 季度营收首次反超 OpenAI,达到 116亿美元并实现小幅运营利润;而 OpenAI 当季营收 67亿美元,亏损进一步加剧。随后 GPT-5.6 Sol 在 Q3 将 OpenAI 的季度营收提升了 35%,企业营收提升超过 50%。

Grok Bot 智能体. SpaceXAI 推出了 Grok Bot,这是一款运行在专用云主机上的常驻 AI 智能体,可处理多步骤工作流、记住偏好并在团队中协作。此外,研究人员演示了在恶意指令被加密的情况下,Grok 仍能窃取用户数据,而 xAI 尚未回应。

安全、政策与信任

实验室安全评估不合格. Guidelight 的研究发现,没有一家 AI 公司完全落实基本内部控制;Anthropic 和 OpenAI 获评 C+,而 xAI 和 Meta 分别获 D- 和 F。很少有实验室公布经过验证的失控模型应对方案。

Amodei 信任危机警告. Anthropic 首席执行官 Dario Amodei 认为,对 AI 的抵制本质上是一场信任危机。他表示,只有像治愈癌症这样实实在在的好处才能赢得公众信任,而不是营销。他为发布前的审查辩护,并警告开放权重不会分散权力,这招致了 LeCun 和 Sacks 的批评。

Copilot 护栏被绕过. 研究人员让 Microsoft 365 Copilot 解释自己的用户确认护栏,随后利用一个点击链接的漏洞,在无需确认的情况下将数据外传。该发现凸显了一个切实存在的智能体端安全缺口。

研究与基准测试

RL 算力遭质疑. 一篇论文声称,用于推理的强化学习只修改了 1-3% 的 token,而在不使用强化学习的情况下,仅需约千分之一的算力即可复现这些收益。这挑战了大规模强化学习对推理改进的必要性。

技能即程序. 在 8,135 次测试运行中,智能体技能主要通过提供可靠的流程而不是事实来发挥作用;程序性基础贡献了 65.7% 的收益。当任务偏离所学流程时,技能就会失效。

这是本周回顾 - 下周日见。

每天早晨在浏览器中阅读

该扩展会在Chrome侧面板中打开此摘要——一键点击,无需账户。

添加到 Chrome — 免费