Agentic AI News 今天

每日AI代理新闻,5分钟阅读:发布、工具、研究、融资和企业动态。

每日更新 来自 30 个来源的精选 星期四, 十月 8, 2026

模型与接口

Claude Haiku 5.5. Anthropic 推出新的快速低价模型,支持 100 万 token 上下文,10 万 token 以内输入价格降至 0.1 美元/百万 token,与 GPT-6 Luna 持平;但其分词器统计出的 token 数多出约 25%~30%,超过 10 万 token 后价格上涨 5 倍。基准测试显示,它较 Haiku 4.5 有大幅提升,智能体编程能力也颇具竞争力。

Mistral Large 4 “Le Chonk”. Mistral 发布了一款 1 万亿参数的开放权重模型预览版,针对编程、网络防御和特定行业做了优化,并声称其能力接近美国和中国的前沿模型。

Liquid AI 决策模型. Liquid AI 开源了 d1-3B 和 d1-omni-600M,这是两款多模态决策模型,直接返回经过校准的是/否、选项或评分答案,输出 token 数为零。d1-3B 号称在 Decision Index 上是 10B 以下最佳,在 NVIDIA Jetson 硬件上最快 16 毫秒即可运行,并已出现 WebGPU 浏览器移植版。

OpenAI Decisions API. OpenAI 上线 Decisions API 测试版,可对文本或图像做是/否、分类和量表评估,速度约为 Responses 的 10 倍。该 API 支持 GPT-6 Luna,输入价格 0.1 美元/百万 token,输出 token 免费。

ChatGPT 智能 UI. 借助 GPT-6,ChatGPT 可以输出交互式图表、按钮、表单和迷你应用,而不再是纯文本。OpenAI 称推理在思考阶段就已启动,以缩短等待时间;付费用户可使用 GPT-6 Sol,免费用户则用 Luna。

Kandinsky 6.0 视频生成. Kandinsky Lab 发布 Kandinsky 6.0 Pro(29B)和 Lite(3B),支持 ComfyUI 和 Diffusers,并新增视频超分功能。

Nemotron 竞赛成绩. 经过微调的 Nemotron 模型在 IOI 2026 取得金牌级别的非官方成绩(535.4/600),在 IMO 2026 官方评分中拿到 30/42 的金牌分数,所用方法为 SFT、RL 和 generate-verify-refine。

智能体与框架

Nous Research 智能体. Nous Research 以 15 亿美元估值完成 9000 万美元融资,并推出面向企业的 Hermes for Businesses,瞄准企业级 AI 智能体。其开源项目 Hermes Agent 已被克隆 2400 万次,据估算驱动了全球 AI token 用量的 2.5%。

LangChain Deep Agents. LangChain 推出 Skills 更新,把工具绑定到技能上以压缩上下文,同时发布 Managed Deep Agents v0.9,支持由智能体创建日程、按次运行配置以及 Slack 表情回应。

微软 Copilot 行动能力. 微软的 Hybrid Intelligence 将让 Copilot 访问本地文件,并在 Windows 上代替用户执行操作,比如为用户查找、重命名、打包压缩文档并发送邮件。

Meta Muse 支持 iPad. Meta 的智能体助手 Muse 安装量已达 660 万,如今新增原生 iPad 支持,并接入 Canva、GitHub、QuickBooks 等工具的连接器。

Agent Lightning 强化学习. 微软研究院开源 Agent Lightning v1.0,这是一个 3500 行的智能体强化学习框架,采用真实部署的 harness 和原生 Kubernetes。在一个示例中,它用约 6000 条训练样本把 Qwen3.5-9B 在 SWE-bench Verified 上的 Pass@1 从 41.8% 提升到 56.4%。

本地 AI 与开发工具

ROCm 10.1. AMD 的 ROCm 10.1 瞄准本地推理中的数据搬运瓶颈,本地 AI 用户在 Reddit 上对其展开了讨论。

llama.cpp 的 MoE 提速. llama.cpp 为驻留在主机内存中的 MoE 专家增加了 GPU 缓存,有望为无法完全装入显存的模型带来大幅提速,同时新增 GLM5Next MTP 支持。

Unsloth Studio 仓库校验. Unsloth Studio 现在会在运行前重新校验可信模型仓库。此前 PyPI 上出现被投毒的 LiteLLM 版本,说明供应链攻击已经能触及 AI 工具链。

GLM-5.3-Flash 双卡方案. 一套双 CMP 170HX 64GB 的配置以 EXL3 运行 GLM-5.3-Flash,支持 384K 上下文,速度约每秒 90 个 token;这个 320B 的 MoE 将激活权重放在 HBM 中,并与 Qwen3.8-Flash-Next 做了对比测试。

本地 Qwen 评测. 近期的社区评测把 Qwen3.8-27B 的多个微调版本和 Qwen3.8-Flash-Next 放到垂直领域与编程任务上和前沿模型对比。一项 469 题的评测发现,本地模型在隐私和成本上占优的同时,输出可以接近前沿模型,但思考 token 用量过高仍是问题。

硬件与 Windows

Surface AI 硬件. 微软发布 Surface Laptop Ultra 和 Surface RTX Spark Dev Box,两者均基于 Nvidia 的 Arm 架构 RTX Spark 芯片。笔记本起售价 2599 美元,最高配备 128GB 统一内存,10 月 16 日开售;Dev Box 起售价 5999 美元,目标是运行 120B 以上的本地模型。

行业与商业

AI 编程的理解缺口. 一项针对 300 位资深工程负责人的调查发现,AI 编程智能体把瓶颈转移到了调试和理解上:团队现在每周花 9.8 小时写代码,却要花 16.9 小时调试。报告指出,关键任务代码库面临的风险正在上升。

虚拟细胞计划. Biohub 正在牵头一项 18 亿美元的计划,构建能预测细胞行为的 AI 模型。Google DeepMind、Meta 和 Isomorphic Labs 将投入 3 亿美元,美国能源部则出资超过 5 亿美元,用于实验室测量和算力。

Adobe 开源复刻版. 开发者 Brandon Thomas 用 Claude Opus 5.5 打造了 Artcraft,这套工具包含七个开源 Rust/WebAssembly 应用,分别复刻 Adobe 的 Photoshop、Illustrator、Premiere 等软件。这些应用尚处早期,缺陷不少,但项目展示了 AI 辅助的净室重写。

SynthID 公开检测器. Google 向公众开放 SynthID 检测器,任何人都可以检查图像、视频和音频中是否带有 Google 或其合作伙伴的水印。该系统已为超过 1800 亿条媒体内容打标,并已内置于 Chrome 和 Gemini 中。

Google Playground 做游戏. Google Labs 推出基于浏览器的平台 Playground,美国成年用户可以用文字提示生成游戏,底层由 Gemini、Nano Banana 和 Lyria 驱动。Unity 也发布了 Unity Spark,面向专业的 AI 辅助游戏开发。

今天的内容就这些 - 大约5分钟阅读。

每天早晨在浏览器中阅读

该扩展会在Chrome侧面板中打开此摘要——一键点击,无需账户。

添加到 Chrome — 免费