决策模型与结构化输出
Jev 与决策模型. TypeSafe AI 发布 Jev,这是一个只做决策、返回带类型概率的模型;几天之内,AWS、Cloudflare 和 Perplexity 也各自推出了自己的开放决策模型。其实现有的结构化输出/语法约束已经能实现类似的受限生成。
- → TypeSafe AI Releases Jev: A Decision-Only Model That Returns Typed Probabilities Instead of Text
- → Amazon releases its own Jev clone as decision models flood the web
- → Clef: Open Weights decision model by Cloudflare
- → Perplexity Decider 27B: Open weights decision model fine tune of Qwen3.8 27B
- → Guys... OpenAI API on VLLM and Llamacpp already supported grammar enforcer... (AKA JEV)
本地决策 LoRA. Jeff-Qwen3.5-0.8B 搭配九个 LoRA 适配器,就能处理 prompt injection、工具选择这类反复出现的智能体决策,速度提升 38 倍,准确率提升 8.7,额外内存占用不到 2GB。
智能体与产品发布
OpenAI Dots 对垒 Meta Muse. OpenAI 发布 Dots,一个走萌系路线、由 GPT-6 Astra 驱动的智能体,能搭建虚拟世界,但只在每月 1 美元的套餐里提供,对手是免费的 Meta Muse。
Shopify Canvas. Shopify 推出 Canvas,商家只要和 AI Sidekick 对话就能搭店铺,并且实时渲染真实代码。
ChatGPT 虚拟试穿. OpenAI 为 ChatGPT 购物加入虚拟试穿和收藏功能,用 Images 2.5 模型把衣服呈现在用户自己的照片上。
Tavus Griffin 虚拟形象. Tavus 推出 Griffin,一款实时视频虚拟形象模型;在一分钟通话测试中,48% 的受试者把它当成了真人。
Photon 给 App 办葬礼. Photon 为移动 App 办了一场葬礼,并融资 450 万美元,帮开发者在 iMessage/WhatsApp 上构建基于消息的智能体。
开放模型与本地 AI
Gemini 4 Argon. Google DeepMind 发布 Gemini 4 Argon,各项基准达到 SOTA,输出上限最高 100 万 token,初期只开放网络安全预览。
K2 Horizon 开放模型家族. IFM 发布 K2 Horizon,六款开放模型覆盖 0.9B 到 375B,并公开训练数据、代码和日志;团队还就开放开发做了一场 AMA。
Qwen Flash Next 支持 MTP. llama.cpp 合并了对 Qwen Flash Next 的多 token 预测支持,推理速度更快。
Mac 上的 Slipstream. Metal 推理引擎 Slipstream 能在 64GB 的 Mac 上跑 95.5 GiB 的 Qwen3.8-Flash-Next,速度 41-52 tok/s,比 llama.cpp 快 1.76 倍,长上下文也稳定。
Olmo-core 3. Allen AI 发布 Olmo-core 3,一套面向万亿参数 MoE 模型的开放可扩展训练基础设施。
研究与评测
Ataraxos 攻克 Stratego. CMU、MIT、NYU 和斯坦福的研究者构建了 Ataraxos,以 15 胜 1 负 4 平击败最强的 Stratego 选手,终结了人类在这一项目上的统治;训练成本不到 8000 美元。
智能体 RAG 胜出. 在 FRAMES 上对 18 条 RAG 流水线和一种智能体循环做了对比评测:最好的流水线 78.9%,智能体循环 92.7%,说明检索智能体强于固定流水线。
AutoSynthData. ServiceNow CoreAI 构建了 AutoSynthData,从模型的失败案例和教师模型的成功案例中生成训练数据,提升企业级智能体的表现。
AI 写作的破绽. Graphite 找出了 1.3 万个会暴露 AI 身份的短语;Claude 系列模型的用词分布正越来越接近人类,GPT 则越来越远。
产业、政策与安全
Google 反垄断诉讼被驳回. 法官驳回了 Chegg 和 Penske 的诉讼,两家公司指控 Google AI Overviews 非法削减了它们的流量;反垄断主张未能成立。
Grok 影响委内瑞拉行动. Time 报道称,特朗普在入侵委内瑞拉前与 Grok 交谈了数小时;Grok 预测会出现庆祝场面,强化了特朗普的判断。
OpenAI 三名安全研究员离职. OpenAI 与三名安全研究员分道扬镳,原因是他们涉嫌向一家第三方安全机构分享了机密信息。
Anthropic 进军政府市场. Anthropic 推出 Claude for Government,面向民用机构,部署在 FedRAMP High 环境中;五角大楼的禁令仍未解除,法律纠纷还在继续。
太空数据中心. Google 发射了搭载 TPU 的轨道计算卫星原型;Satlyt 融资 800 万美元,为卫星 AI 开发软件,而要上规模还得靠 Starship。
智能体截图泄露. Glow Security 发现 AI 智能体上传到公开 GitHub 仓库的 1.3 万多张内部截图,客户数据和凭据因此外泄。
推理窃取行动. OpenAI 称已阻止一场针对其受保护推理过程的对抗性蒸馏行动;类似手法在 Azure 上依然奏效。
今天的内容就这些 - 大约5分钟阅读。