Agentic AI News 今天

每日AI代理新闻,5分钟阅读:发布、工具、研究、融资和企业动态。

每日更新 来自 30 个来源的精选 星期六, 八月 15, 2026

模型发布

Qwen 3.8 27B. 阿里巴巴的Qwen团队发布了Qwen3.8-27B以及更大的Qwen3.8-2.4T-A95B,采用Apache 2.0许可证。这款27B稠密模型与Qwen3.6-27B共享相同的架构,但通过训练改进提升了编码、办公任务和代理规划能力。它支持262k原生上下文,可扩展至1M tokens。

来自Zhipu的GLM-5.3. Zhipu AI发布了GLM-5.3,它使用与GLM-5.2相同的基础模型,但扩展了后训练。该公司声称它是最强的开放权重编码模型,在代理编码和网络安全漏洞发现方面有显著提升。权重预计将在两周内上传到Hugging Face。

Meta的Muse Glimmer. Meta开源了Muse Glimmer,这是一个采用Apache 2.0许可的30B代理模型,旨在消费者GPU上的本地工作流。它从更大的Muse Spark中蒸馏推理和工具调用技能,并曾短暂成为30B级别的领先模型。

中国开源模型浪潮. 在不到一个月的时间里,中国实验室发布了Kimi K3、Qwen3.8、DeepSeek-V4-Pro-0813和GLM-5.3,凸显了开放权重前沿的快速进展。

本地部署与社区

Apple Silicon加速. 新的mlx-dspark版本为Apple Silicon上的Qwen3.8-27B带来了推测解码,在M4 Pro上实现了最高约3倍的生成速度提升,同时产生相同的输出token。

量化与权重. Unsloth发布了Qwen3.8-27B量化权重,Tim Dettmers预告了一种新的量化方法,可以在单个DGX Spark上以7 tokens/s的速度运行GLM-5.3。

Qwen 3.8早期测试. 社区测试显示Qwen3.8-27B表现出强大的一次性编码演示和代理行为,但一些用户报告在xhigh推理强度下,常识知识明显被裁剪,思考轨迹极长。模型卡上提供了推荐的采样参数。

无审查本地变体. 社区版本的Qwen3.8-27B 'heretic'移除了拒绝和安全防护,旨在提供与Opus 4.6等前沿模型相当级别的本地无审查替代方案。

AI透明度与安全

Anthropic水印检测. Anthropic将提供水印检测API,使第三方开发者能够检测可能由Claude生成的文本。该方法使用SynthID Text,在短文本、事实密集或大幅改写文本上可靠性较低。

Google使水印可选. Google允许用户关闭来自Nano Banana、Omni和Lyria的AI生成图像、视频和音乐上的可见水印。仍然会嵌入不可见的SynthID和C2PA元数据以供验证。

法庭上的提示注入. 康涅狄格州一名法官记录了一份似乎是美国首份带有隐藏文本的法院文件,该文本旨在操纵审查案件的AI系统。这些隐藏指令没有产生效果,但法官称这种策略是危险的。

生产环境中的代理

Claude Code维护职责. Anthropic表示Claude Code一直在其自己的应用上运行日常维护,创建了388个拉取请求,人工审核后合并率为46%。日常维护包括崩溃模糊测试、重复抽象清理和依赖检查。

OpenAI Computer History. OpenAI的Computer History取代了Chronicle截图原型,记录macOS上的点击、按键和应用切换,以构建可搜索的时间线。它可以检测重复工作流,并为ChatGPT和Codex推荐可复用技能。

行业与商业

中美价格战. 随着中国开源模型的崛起,OpenAI和Anthropic正在降价;Google的Gemini 3.7 Flash首次亮相,针对编码和代理推出50%的入门价格折扣。自7月中旬以来,美国领先实验室的token价格已下跌近四分之一。

GPT-5.6 Sol Ultrafast. OpenAI推出了由Cerebras驱动的GPT-5.6 Sol Ultrafast模式预览,每秒可输出高达750个token。该API服务最初仅限特定客户使用,旨在事件或市场事件期间进行实时分析。

Meta的AI普惠. Meta在发布Glimmer的同时,附带了一封扎克伯格的长信,主张AI应对所有人开放,但播客报道指出,该公司将其最强大的Muse Spark保留在API之后。同一讨论还提到一笔2.5亿美元的收购出了问题。

苹果-阿里巴巴中国模型. 据报道,苹果在阿里巴巴的帮助下为中国市场训练了一款定制AI模型,为将Apple Intelligence引入中国设备做准备。这一合作是罕见的中美AI合作。

Kog推理推进. 法国初创公司Kog正在利用软件优化从AMD MI300X和Nvidia H200等传统GPU中挖掘更高速度,目标是为软件工程工作负载实现更快的单请求解码。

天然气价格风险. Noreva的一份新预测警告称,随着亚马逊、谷歌、Meta和微软等超大规模企业为AI数据中心锁定天然气电力,美国部分地区的天然气价格可能会上涨三倍。

研究亮点

150M参数ARC模型. 一个150M参数的循环潜在推理模型在ARC-AGI-1上得分29.5%,每个任务成本$0.0007,处于已发布的成本-准确率前沿之外。它可在极简硬件上运行,但仍需扩展到数十亿参数。

自主研究质疑. 普林斯顿大学和英国AISI的一项研究使用未发表的NeurIPS论文发现,当前的前沿模型能够处理研究工程,但在研究的关键部分表现不佳,这与实验室关于自主AI研究的说法相矛盾。

DarwinX工具链进化. DarwinX通过自然选择在提示、工具、技能和控制流程上进化代理工具链,同时保持模型权重不变。它在四个基准上平均增加约17分,并可直接迁移到SWE-bench Verified。

PlayWorld基准. PlayWorld使用多模态代理玩家来评估视频世界模型,这些代理追求171个长视界目标,衡量几何一致性、交互保真度、视线外演化和洞察演化。

今天的内容就这些 - 大约5分钟阅读。

每天早晨在浏览器中阅读

该扩展会在Chrome侧面板中打开此摘要——一键点击,无需账户。

添加到 Chrome — 免费