Agentic AI News 今天

每日AI代理新闻,5分钟阅读:发布、工具、研究、融资和企业动态。

每日更新 来自 30 个来源的精选 星期日, 八月 23, 2026

本地模型与 agent 工作负载

Qwen3.8 27B 本地运行. 社区测试发现,Qwen3.8 27B 在指令遵循和长上下文任务上强于 Qwen3.6;单张 RTX 5090 可运行 NVFP4 版本(支持 262K 上下文),短输入下 77 tok/s,128K 上下文时 65 tok/s。

推测解码. DFlash 2 配合 n-gram 草稿器,在 LiveCodeBench 提示上为 Qwen3.8 27B 实现 2.26 倍加速,在长编码会话中最高 4.68 倍;Ornith 35B 上的固定 MTP 头则将实际耗时缩短了三分之一。

递归上下文管理. 开发者正在将快速的 64K 主 agent 与递归子 agent 及微型压缩模型搭配,以处理更长的任务,而不必为 300K 上下文付费。

Gemma 工具调用微调. 面向工具调用和 CLI 使用的 Gemma 4 12B 微调模型,将工具使用率提升了 2.7 倍,工具调用尝试次数增加 15.7%,目标设备为 16GB VRAM 配置。

DGX Spark 集群. 一个 36 节点的 DGX Spark 集群被用作 agent 能力集群,节点同时分配给 SOTA 模型、rerank/embedding、视频、图像和音频工作。

工具与框架

llama.cpp 0.2.0. llama.cpp 0.2.0 版本发布,带来预构建产物和最新上游改动,用于本地推理。

Cloudflare Kitesurf. Kitesurf 是一个面向 agent 的浏览器引擎,基于 WebAssembly/Rust Workers 构建,每个页面有独立 DOM;它支持 CDP,因此 Playwright 和 Puppeteer 可以用比完整 Chromium 更低的开销驱动它。

llm 0.33. Simon Willison 的 llm 0.33 新增了 embedding 模型的按调用 API 密钥、可复用模板(用于组合模型配置和提示),以及推理模型的 reasoning_summary 选项。

编码 agent 实践. Simon Willison 认为,编码 agent 的关键在于要有把握地给出指令并验证改动;Linus Torvalds 则提到,某个 AI 在一场棘手的调试中完成了基础工作,但在反复宣称问题无解之后,仍需要被人督促。

研究与方法

技能即行动手册. 在 8,135 次测试运行中,agent 技能主要靠提供可靠的流程(而非事实)发挥作用;程序性依据贡献了 65.7% 的提升,当任务偏离所学流程时,技能就会失效。

心智世界模型. 新研究通过 MENTIS 将人类的信念和意图加入 AI 世界模型;对物理、心理和社会合理性的建模显著提升了对人类行为的预测。

安全基准心理测量. 对八个安全基准的心理测量分析发现,单一分数掩盖了拒绝严格性、真实性和情境危害之间的权衡;模型可以通过过度拦截来抬高安全分数。

可逆 CoT. 一项关于近似可逆推理步骤的提议,结合循环一致性检查和逆计算,可以在边缘 LLM 中捕捉幻觉并减少 KV-cache 内存占用。

模拟一切. Latent Space 认为,合成数据、评分标准和环境正在让 ML 管道的每个组件都由模型制造,效果比人类模拟差 10%,但成本低 100 倍、速度快 10,000 倍。

行业与应用

Inherent Faraday. DeepMind 校友创立的初创公司 Inherent 表示,其 Faraday agent 在独立复现已发表科学发现的表现上优于 Anthropic 和 OpenAI 的模型,而模型规模仅为其一小部分。

LinkedIn AI 评审. LinkedIn 构建了一个多 agent AI 代码评审平台,将反馈基于 diff 和代码库约定,以减少幻觉和低价值评论。

Netflix GenRec. Netflix 的语言模型推荐系统 GenRec 将用户行为转化为文本,在离线测试和线上 A/B 测试中,以少得多的数据击败了手工构建的特征引擎。

DoorDash SafeChat. DoorDash 详细介绍了 SafeChat——一个大规模构建的市场安全系统,而在它开始发挥作用后,DoorDash 又用更强大的架构将其替换。

教育中的 AI 化身. 哈佛商学院 699 美元的 Foundry 训练营使用 HeyGen 的 AI 化身来提供路演和董事会会议反馈;参与者喜欢这种引导式体验,不过真人讲师表示那个仿制品有点瘆人。

模型动态. Liquid AI 正在调研市场对 100B LFM 模型的兴趣;与此同时,一款名为 Ox Alpha 的神秘模型因强大的编码和 agentic 性能而备受关注,有猜测认为它是 GLM 家族的衍生模型。

政策、安全与信任

OpenAI SB 53. OpenAI 此前反对加州 SB 53 法案,如今表示应修改该法案,增加前沿训练期间的监控,并加强网络安全。

遏制方案. Guidelight 的一项研究对五家前沿实验室的失控模型遏制能力进行了评分;OpenAI 得分最高,Anthropic 和 Meta 最低,而很少有实验室公布经过实际验证的应对方案。

Claude 水印方案. Anthropic 为 Claude 文本输出新增的水印技术得到了详细解读,涵盖水印如何施加,以及它的能与不能。

闭源模型信任. Reddit r/LocalLLaMA 的一个帖子认为,OpenAI 在作业任务上故意保留实力,并且正偏离用户赋能,促使从业者为了 agentic 循环重新转向本地模型。

今天的内容就这些 - 大约5分钟阅读。

每天早晨在浏览器中阅读

该扩展会在Chrome侧面板中打开此摘要——一键点击,无需账户。

添加到 Chrome — 免费