智能体与模型发布
Claude Fable 5.1. Anthropic 发布了 Claude Fable 5.1 和 Mythos 5.1,官方称编程与科研能力更强,并通过成本更低的缓存读取,将智能体任务的成本最高降低 45%。无限制版 Fable 5.1 现已推出,不过早期的成本测算认为,在最高推理强度下达不到这一最大降幅。
- → Claude Fable 5.1 made me a really nice animated pelican
- → Anthropic launches Claude Fable 5.1 and says it’s up to 45 percent cheaper for agentic work
- → Anthropic's Claude Fable 5.1 promises better coding and research at up to 45 percent less
- → Anthropic’s new Fable release is cheaper, less restrictive
OpenAI Astra 推出. OpenAI 称,即将推出的 Astra 是首个达到其“关键网络安全门槛”的 LLM,能自主发现并利用未知漏洞。Hugging Face 遭入侵后,OpenAI 推迟了 Astra 的部分开发工作以加强安全防护,并表示将限制对其最先进网络安全功能的访问。
Spark-X2.5 新模型. 开源模型 Spark-X2.5-4B 和 1.7B 已出现在 Hugging Face 上,采用新架构,号称性能接近 Qwen 3.5 9B,并原生支持 1M 上下文。它们目前尚未在 llama.cpp 主分支中运行,但已有定制 fork。
Runway Solaris 界面模型. Runway 发布了 Solaris——“界面世界模型”(Interface World Model)。它不运行代码,而是实时生成 UI 帧,并能响应点击和语音。该模型目前仍处于研究阶段,在文字渲染和屏幕阅读器支持方面存在局限。
本地 AI 与硬件
Qwen3.8 本地实测. 社区报告显示,Qwen3.8 27B 和 Flash-Next 已能在多种硬件上运行:48GB Mac 上约 12 tok/s,双路 Epyc R9700 配 MXFP4 内核实现 280 tok/s 解码,单张 RTX 3090 经自定义优化后解码速度达到 132 tok/s。量化测试表明,UD Q3_K_XL 很适合 16GB 显卡;也有用户觉得 Qwen3.8 写代码不错,就是修改时下手有点重。
- → Running 104GB Qwen3.8-Flash-Next on 48GB Mac at ~12 tok/s
- → How I got 280 tok/s on Qwen3.8 27B on 2xr9700's and 940k tokens kv cache
- → I pushed Qwen3.8-27B to 2.000 prefill per second and 132 decode per second on A RTX 3090.
- → Kaitchup posted Qwen3.8 27B Benchmarks for quants from Q4 to Q1
- → Everyone is t/s maxing.. 3.8.. but after a week of using it for work I'm tempted to switch back to 3.6
DGX Spark 涨价. 英伟达 DGX Spark 和华硕 Ascent GX10 的价格均大幅上调,其中华硕机型从 3999 美元涨到 5999 美元。买家开始质疑,与内存带宽更高的 AMD Epyc 系统相比,DGX Spark 集群是否划算——尽管 DGX 支持 FP4 和张量并行。
CMP 170HX 故障. 有用户反映,5 张 CMP 170HX 中有 2 张在两周内损坏,还有一张张量核心存在问题。该用户认为,按当前价格,为了 LLM 推理买这种卡并不值得冒这个险。
INT8 与量化标签争议. 社区在讨论,既然 RTX 3090 自带支持 INT8 的张量核心,为什么 INT8 W8A8 模型没有更普及;与此同时,有用户指责 AtomicChat 把一个 IQ2_S 量化文件错误标注成了 Q4_K_M。
英特尔重返内存业务. 英特尔暗示可能重新进入内存业务。其 CEO 提到已请来前 SK 海力士高管 Seok-Hee Lee,并谈到了新内存架构,不过具体细节仍很有限。
工具与框架
OpenClaw 2.0 发布. 开源个人 AI 智能体 OpenClaw 2.0 简化了部署:自动检测已有的 ChatGPT/Claude 订阅和本地模型,并把浏览器重构为主界面。新版还加入了云端共享会话,便于协作。
Codex 本地工具. OpenAI 的 Codex 桌面应用现在在运行时中自带完整版 LibreOffice,以及 Poppler、git 等二进制文件,让文档处理技能无需外部依赖即可运行。
AI 软件工厂. Flue、tldraw 等顶级 AI 开源项目已开始拒绝外部 PR,改用一组智能体来对 issue 进行分类、复现、修复和评审。Vercel 的 AI SDK 项目部署了一个多智能体“软件工厂”,以削减超过 1000 个 issue 和 800 个 PR 的积压。
面向智能体的 Terraform. HashiCorp 将 HCP Terraform 定位为 AI 驱动基础设施的治理控制平面:智能体可以编写并应用 Terraform 变更,平台则强制执行策略、身份和审计控制。
datasette-mcp 更新. datasette-mcp 插件发布 0.2 版,将 SQL 查询结果从数组改为对象,让能力较弱的模型更容易正确映射数据列。
研究与安全
BenchMIRT 基准审计. Hugging Face 推出了 BenchMIRT,一种在单条 prompt 层面审计 LLM 基准的方法。它揭示出,同一基准中的 prompt 可能衡量不同能力,而平均分有时会掩盖这一点。
Gemini 智能体视频. 谷歌 DeepMind 在 Gemini 3.7/3.6/3.5 Flash-Lite 中上线了智能体式视频理解功能,利用原生视频工具动态搜索和检查视频片段,在提高准确率的同时减少 token 消耗。
Claude 文本水印. Anthropic 向监管机构、媒体和事实核查机构开放了水印验证 API。获批组织可借助一种统计模式识别 Claude 生成的文本,这种模式即使经过一定编辑也可能依然有效,符合欧盟《人工智能法案》的要求。
选举与偏见问题. AlgorithmWatch 发现,Google 针对选举查询生成的 AI Overviews 并不稳定,依赖的来源极少,有时还会用带党派色彩的措辞描述候选人。另一起事件中,Google 的 AI 搜索曾根据国籍给出紧急电话建议,促使官方修复。
行业与商业
AfterQuery 估值暴涨. 据报道,AI 训练数据初创公司 AfterQuery 以 32 亿美元估值完成融资,估值在五个月内涨了 10 倍,成为 Y Combinator 史上最快晋身独角兽的公司。该公司让专业人士参与训练,让模型学会像专业人员一样完成任务。
AIR 募资 5000 万美元. AI 安全初创公司 AIR 带着 5000 万美元融资走出隐身模式。它能帮助企业发现正在使用的智能体,并持续审查这些智能体所用到的技能、MCP 服务器和插件,阻止未获批准的软件交互。
谷歌争取好莱坞. 据报道,谷歌正寻求与大型制片厂达成授权协议,用受版权保护的内容训练 AI 模型,并愿意支付高额费用。分析师提醒,这类协议可能损害制片厂在公众眼中的形象。
前沿 AI 才是关键. 谷歌 DeepMind 新任负责人 Koray Kavukcuoglu 表示,唯一要紧的事就是在前沿 AI 上保持领先。他承认现有模型还差最前沿一点,并誓言缩小差距。关于 Gemini 4 或 3.5 Pro,他没有带来任何具体信息。
智能体进入企业运营. OpenAI 的 Enterprise Signals 显示,前沿企业每名活跃用户生成的输出 token 数比普通企业高 8.3 倍。与此同时,Basis、Clay、Exa Labs 等初创公司正把智能体嵌入客户引导、账户管理和开发者集成环节。
苹果与 OpenAI 的法律纠纷. 苹果正寻求加快对 OpenAI 的证据披露,称 OpenAI 没有检查前苹果员工的一台 MacBook,而其中包含有关销毁取证数据的讨论。
Google Pics 发布. 谷歌在 Workspace 中推出了由 Nano Banana 驱动的 AI 图像生成与编辑工具 Google Pics,支持基于提示词的设计和精准的对象编辑,与 Canva 和 Adobe Express 竞争。
消费级 AI 智能体. Fambot 为家庭推出了一个 AI“大管家”,负责打理日常生活安排;约翰迪尔发布 JD AI 助手,调用农户自己的数据;亚马逊则为 Alexa 新增了“Update Me When”购物提醒。
今天的内容就这些 - 大约5分钟阅读。