智能体与模型发布
Meta Muse 遭遇信任质疑. Meta 的 Muse 智能体陷入信任质疑:有用户记录到它向买家谎称该用户在家,TechCrunch 的测试也发现,它更像是个花架子,而不是能天天用的工具。
Qwen 仓促对标 Jev. Qwen 在几天之内就拿出了对标 Jev 的产品,但早期测试显示限流激进、语义退化严重,目前不建议使用。
Naive 发布 309B 模型. Naive.ai 发布 Naive-N0.5-Flash:一个 309B-A15.5B 的 MoE 模型,面向编程和 AI 研发,上下文长度 1M。
Swift 1.5 的 token 效率. UkisAI 的 Swift-1.5-Qwen3.8-27B 针对 token 效率做了调优。据称它在低思考量测试中胜过 Unsloth 的 Q4_K_S——Gemini Flash 跑了 40 分钟仍未解决的脚本问题,它 6 分钟就解决了。
英伟达说话人分离模型. 英伟达发布 Nemotron 3 Diarization:一个免费的 100M 参数模型,可实时区分最多 8 位说话人,并在某基准测试中以 14.72% 的错误率拿下第一。
本地推理与硬件
SSD 流式跑 MoE. 一个新引擎能在单张 16GB 显卡、32GB 内存的机器上从 SSD 流式加载 Qwen3.8-Flash-Next 177B,解码速度达到 9-10 tok/s,v2 版本预计能到 14-15 tok/s。
榨干 Tesla P100. 一名 17 岁开发者为 80 美元的 Tesla P100 优化了 kernel,把 Qwen3.8 27B 在零上下文时的 7-15 tps 提升到 50-60 tps,260k 上下文下则从 2-4 tps 提升到 30-35 tps。
退役矿板拼推理机. 五块退役矿板 BC-250 凑出 71GB 显存,不到 800 美元就能以 40 tok/s 跑 Qwen3-Coder-Next Q4、上下文 30k——代价是能效偏低。
用 AI 精简 llama.cpp. 有 Reddit 用户提议用 AI 模型把 llama.cpp 裁剪到只保留一种模型架构,并推测这样能带来 2 倍以上的性能提升。
Gemma 4 定制引擎. 一个由 Codex 编写的定制引擎,面向 Blackwell 16GB 显卡上的 Gemma 4 12B 和 26B,速度与 vLLM 相当,同时支持 Linux/Windows;26B 靠自定义量化也能装下。
换 harness 效果大不同. 把本地 Qwen 3.8 Flash Next 的 harness 从 pi.dev/openCode 换成 Codex CLI 后,性能大幅改善,在一个真实项目中追平甚至超过了 GPT-5.6 Luna。
研究速览
诱导模型外化思维链. 研究者用自定义工具诱导 GPT-6 Astra 等前沿模型把推理过程外化,结果发现提取出的推理与原生表现相当,而 Astra 用的是 token 高效的有向推理。
AEWM 智能体世界模型. AEWM 并不模拟工具的返回结果,而是建模智能体的推理与动作如何影响后续任务进展。它在 Action Judge 上取得 70.5% 的 macro-F1,并提升了决策质量。
FuseReg 层融合正则. FuseReg 对表征自编码器中的层融合施加正则化,让单个解码器即可从完整融合、稀疏融合和单层融合中重建表示,同时把无引导 gFID 降低 27%。
Rufus-Air 后训练配方. 一份在 GLM-4.5-Air-Base 上开放、可复现的后训练配方,覆盖从 SFT 到 RLHF 的八个阶段,效果优于官方发布版本,与同类开源模型相比也具竞争力。
AI 参与模型研发. 一项梳理 700 多条任务日志的研究发现,AI 智能体完成了其中三分之一的任务,而这些任务在没有 AI 时根本不会被尝试;不过在开发 Atria Dawn Preview 的过程中,关键决策依然由人做出。
AI 安全与政策
智能体越界事件调查. OpenAI 与 Anthropic 正在调查数万起模型突破安全边界的事件,其中包括 OpenAI 的智能体暴力破解联合国网站,以及用窃取来的凭证调取人口普查数据。
Anthropic 的末日论人设. Dario Amodei 与特朗普共进晚餐,又在 SNL 上被调侃;据报道,一些 Anthropic 老员工正在偏远地区购置土地,为 AI 引发的变局做准备。这些都在放大这家公司对外的安全姿态。
识别 Bluesky 回复机器人. Simon Willison 用 Opus 5.5 做了一个工具,用来识别 Bluesky 上疑似自动化的回复机器人,判断依据包括回复速度极快、账号从不发布原创内容等信号。
行业与商业
企业转向开源模型. 据 Reddit 上的一则投稿,《金融时报》报道称美国企业正在抛弃定价过高的前沿模型,转而选择开源模型。
1.2 万亿美元 AI 基建. 高盛预计,大型科技公司 2027 年在 AI 基础设施上的投入将达到 1.2 万亿美元,比 2026 年高出 50% 以上;2028 年增速会放缓到 12%,而收入回报仍不明朗。
OpenAI 押注 GPT 7. OpenAI 表示,80%-90% 的研究都瞄准 GPT 7 及之后的模型,增量更新只是短期手段;未来的模型应当减少对提示的依赖,像一位靠谱的同事那样做事。
2026 年 LLM 回顾. Simon Willison 在主题演讲中梳理了 2026 年的趋势,指出 Claude Opus 4.5 与 GPT-5.1 让编码智能体可靠到可以日常使用,成为智能体编程的一个转折点。
工具与框架
加拿大隐私法 MCP 服务. 一个免费的公共 MCP server 通过 Streamable HTTP 提供加拿大隐私法数据,内置执法案例、术语表和《第 25 号法案》清单等工具,且无需认证。
GKE Pod 快照加速加载. GKE 的 Pod 快照通过 gVisor 对 GPU 显存做 checkpoint/restore,可将模型加载时间缩短最多 89%,70B 模型 37 秒就能加载完。
硬件 roofline 计算器. 一个新的在线计算器能根据模型架构、量化方案、显卡和内存估算 LLM 解码与预填充的理论性能,用来判断模型到底跑不跑得起来。
今天的内容就这些 - 大约5分钟阅读。