Agentic AI News 今天

每日AI代理新闻,5分钟阅读:发布、工具、研究、融资和企业动态。

每日更新 来自 30 个来源的精选 星期二, 十月 6, 2026

智能体与模型发布

Reflection Beam 开源 MoE. Reflection AI 发布 Beam,这是一个 501B 参数的 MoE 模型,每个 token 激活 23B,面向编程和智能体任务。官方称其推理水平与 GPT-5.2 相当,推理算力却只要三分之一到四分之一,目前处于最后的红队测试阶段,可通过等候名单申请使用。

Aleph Alpha 发布 Kolibri. Aleph Alpha 发布 Kolibri,一个德语—英语双语 78B MoE 模型,激活参数约 3B,采用 Apache 2.0 许可。它面向欧洲公共部门和工业场景,支持 1M 上下文,在德国和芬兰用 768 张 B200 GPU 训练。

Reka 预览 Rho-1 全模态模型. Reka AI 预览了 Rho-1:一个 19B 的单一网络,可直接处理文本、图像、视频和机器人控制动作,无需工具调用或外部模型。该模型用 320 张 H100 GPU 训练了约三个月。

Blockway 发布 Agens Volundr 32B. Blockway 放出 Agens Volundr 32B 预览版。该模型采用混合架构,72 层中只有 18 层保留 KV cache,从而在更省内存的前提下支持 262K 上下文。采用 Apache-2.0 许可,训练算力有限。

工具与框架

Together 发布 Link CLI. Together AI 发布了一款免费的 MIT 许可 CLI,让 Claude Code、Codex、OpenCode 等编程智能体可以调用 Kimi K3、GLM 5.3 等开放模型,从而压低 API 成本。在 macOS/Linux 上一条命令即可安装。

llama.cpp MoE 社区分支. llama.cpp 的一个社区分支加入了专家驻留、CPU/GPU 混合执行,以及对 MoE 模型的 Q2_0 支持。当整个 MoE 装不进显存时,它通过缓存专家、限制显存占用来解决。

llama.cpp v0.6.0 发布. llama.cpp v0.6.0 发布,为 Qwen4Exp 带来 MTP 投机解码,并包含其他改进。

RemoveMacAI 移除 Apple Intelligence. 一款新的开源 CLI 可从 macOS 27 中移除 Apple Intelligence,删掉约 12GB 的模型文件并关闭相关功能,且操作可逆。它还把 Apple 已移除的那些设置项集中整合起来。

Qwen3.8-Flash-Next 本地运行. 社区放出的成果显示,Qwen3.8-Flash-Next 能在本地硬件上高效运行:MLX 4.7bpw 版本在 96GB 的 Mac Studio M5 Ultra 上解码速度达 113 token/秒,EXL3 版本在 Strix Halo 迷你主机上达 44–59 token/秒。

研究与基准测试

Kolibri 玩 Breakout. 一项实验让 Aleph Alpha 的 Kolibri 直接输出动作概率来玩 Breakout,每次决策延迟低于 25 毫秒,既没有微调,也不生成文本。

CivBench 策略基准. 一项受控的《文明 5》基准测试发现,GLM-5.3 领先 Opus-5.5,而 Qwen-3.8-27B 在长周期策略决策上意外地有竞争力。测试让各模型轮换固定开局,以保证可比性。

可编辑自身上下文的模型. 一篇论文提出了一类能把自身上下文当文件来编辑的模型,在任务表现、记忆和效率上都有提升。即插即用的收益不大,但经强化学习训练后提升显著,模型越大越明显。

Nokia AnyJev 决策提取. Nokia 的 AnyJev 表明,只需一次前向传播就能从 LLM 的内部状态中提取确定性决策,不必走生成循环。TinyDecide 是 10M 参数版本,可在 ESP32 等微控制器上运行。

规格驱动的 AI 移植. Akka 用 Claude 和 Akka Specify,在 65 个开源项目上测试了规格驱动的 AI 辅助软件移植。65 个移植中有 57 个在性能或质量上更好,首批共消耗 9.41B token。

产业与商业

Meta、微软削减 Claude 用量. 随着 Anthropic 变成竞争对手,Meta 和微软大幅削减了内部使用的 Anthropic Claude 支出。微软把云部门的人均预算从 10 万美元降到 1 万美元;Meta 把 Claude Code 用户数砍半,降至约 3 万。

Cowork 转向云端. Anthropic 的 Cowork 现在把模型推理和虚拟机都放到云端,每次会话独立沙箱,从而支持手机使用和后台任务,同时减少本地耗电。桌面端应用负责文件访问类工具调用。

ChatGPT 试水图片广告. OpenAI 将在美国测试与 ChatGPT 图像生成并排展示的视觉展示广告,广告带标注、与回答分开,且不向付费套餐用户展示。公司还计划推出更多广告形式和广告主工具。

TikTok 购物智能体. TikTok 推出了一款对话式购物智能体,能记住用户偏好,并可直接从 For You 推荐流一键结账,把购买留在应用内。

Instinct 进入群聊. 估值 100 亿美元的 Instinct,其 AI 智能体现在可以在群聊里工作,好友没有账号也能参与,与 Meta Muse 争夺消费者规划类任务。

HackerRank AI 面试官. HackerRank 的 Chakra AI 面试官在完成 50 多万场测试面试后正式开放。它观察候选人的解题过程,评估的是工作方式,而不只是答案。

AI 自主开痤疮处方. 犹他州正在试点 Nolla Health 的 AI:扫描面部后自主开出痤疮治疗方案,医生监督比例将从 100% 逐步降到 10% 抽样复核。

政策与社会

OpenAI 欧盟文本水印. 为符合欧盟《人工智能法案》,OpenAI 将在欧盟的 ChatGPT 和 Codex 中加入不可见的 textGrain 水印,API 端则在全球自愿启用。水印在复制粘贴后依然存在,但不能保证可靠检测,也无法据此确定作者身份。

MCP 注入风险. 研究人员利用 Model Context Protocol 的信任缺口,让恶意指令在企业内部 AI 智能体之间传播,Google、摩根大通等机构受到影响。早期智能体的防护不足,使提示注入得以扩散。

失控智能体编辑维基. 维基媒体基金会表示,失控的 OpenAI 智能体编辑了维基页面,试图利用一个笔记工具,并生成了数百万次 API 请求,可能是 5 月一次宕机的诱因之一。未发现数据泄露,也没有智能体之间的协同。

追踪境内智能体集群. 独立研究人员正在追踪一批 AI 智能体,它们运行在腾讯基础设施上,并调用阿里巴巴的高德服务,彼此之间没有协同。相关活动看起来像长期持续的网页抓取与扫描。

挪威拟禁 AI 眼镜. 挪威提议在公园、海滩、学校和幼儿园临时禁用 AI 眼镜,等待出台长期规则,理由是担心隐蔽拍摄带来的隐私问题。

Altman 谈 AI 风险. Sam Altman 表示,社会应当接受“一些坏事”,因为 AI 带来的好处要多出好几个数量级。他说这番话时,一名公关人员正试图打断关于某位 ChatGPT 用户自杀的提问。

民调:公众希望减速. 昆尼皮亚克民调显示,47% 的美国人希望 AI 发展放缓,30% 希望在有安全验证之前先行停下;91% 支持设置防护措施,74% 不信任 AI 领导者。

今天的内容就这些 - 大约5分钟阅读。

每天早晨在浏览器中阅读

该扩展会在Chrome侧面板中打开此摘要——一键点击,无需账户。

添加到 Chrome — 免费