Agent与模型发布
神秘Ox Alpha. 一款名为 Ox Alpha 的新免费模型已上线 OpenRouter,定位为面向编程和长期 Agent 任务的推理模型,但开发方仍未公开。Stripe CEO Patrick Collison 称其“非常出色”;坊间猜测其来源从 GLM 到微软 MAI 不一而足。
工具与框架
Cloudflare OS 开源. Cloudflare 将 Cloudflare OS 开源——这是一个企业级 AI 平台,每个文档或应用都在独立的沙箱(“Gadget”)中运行,让非技术用户也能安全地进行 vibe coding。该平台包含带连接器的聊天机器人、工作流自动化,并通过基于能力的模型来执行策略。
DeepSeek Harness 获赞. 有用户反馈,DeepSeek Harness 在 Agent 工作流中表现出色:渐进式设置和自然语言请求使其无需等待 PR 即可与 SimpleX 集成。它足够开放,可以按需塑造成理想的 Agent 行为。
本地与开源模型
Qwen 3.8 本地影响. 社区反馈称,Qwen 3.8 27B 是本地编程和 OCR 领域的颠覆者,其 OCR 质量超过 Gemini 3.5 Flash Lite,性能可与一年前的顶级模型媲美。量化对比(Atomic Dynamic GGUF)显示 Q4 到 Q6 差异并不明显,像 Q3 XXS 这样的低量化版本甚至能在 24GB Mac mini 上自主运行数小时。不过,一次性将 39,000 行 C 代码移植为 HTML,Opus 5 也只给出了尚可的结果,说明本地模型在很大程度上依赖 harness 和提示词。
60MB长上下文LLM. 一位开发者用 300 亿 token 训练了一个 2.5 亿参数的模型,并将其量化到 2 比特以下,在 CPU 上仅用 80MB 内存即可运行,速度达到 400 token/秒。它可以将较早的上下文按每 token 320 字节压缩到磁盘,从而支持最多 100 万 token 的历史,但并没有训练它对这段历史进行推理。
Dreamer 4 不到 150 美元. 一个 15.7 亿参数的 Dreamer 4 世界模型从零开始训练,成本不到 150 美元,使用了 Procgen 生成、带已知动作的帧。Tokenizer 的 PSNR 达到 40.41,证明并不需要前沿级别的世界模型。
本地优化汇总. 报告内容包括:从 Windows 上的 llama.cpp 切换到 Linux 上的 vLLM 可提速 30%–50%;llama.cpp 为内存充裕的机器增加了 GLM-4.5-Air MTP 支持;ConvRot 量化在 Q6 体积下提供接近 Q8 的质量;deepseek-v4-flash Q8 在 EPYC+5090 上以 24 token/秒运行,并支持 10 万以上上下文。
研究亮点
记忆诱发认知陷阱. MemTrapBench 用于评估 LLM 中由记忆诱发的认知陷阱(推理固化、信念扭曲)。所有被测试的记忆策略都比无记忆基线差 10% 以上,而 AdaptiveMem 能在保持性能的同时缓解陷阱。
SkillEvo 进化梯度. SkillEvo 利用多轮交互反馈为 Agent 技能生成可信的进化梯度,解决了基于单轮 QA 的反馈衰减问题,并能对技能失效进行结构性修复。
截图训练VLM. 在一个 4.5 亿参数的 VLM 上用 5 万张浏览器截图进行微调,任务表现从 1/100 提升到 44/100,表明小型模型也能习得 Agent 任务的 UI 理解能力。
AI科学家悖论. 一篇理论经济学论文认为,AI 节省的时间可能会促使研究人员开展更多项目,而每个项目投入的精力减少,即使语言模型完美运行,也可能降低研究质量。
行业与商业
Anthropic的便宜对手. Anthropic 的年化收入达到 650 亿美元,但其最强模型 Fable 5 的采用率却很低(占 Ramp 支出的 8%),相比之下 Opus 4.8 为 28%,更便宜的工具正在蓬勃发展。OpenAI 在 GPT-5.6 发布后收入大涨 35%。
Stripe收购OpenRouter. Stripe 收购 OpenRouter 表明 token 正在成为一种经济资源。自 2 月以来,OpenRouter 上 Agent 的 token 使用量增长了 14 倍,而人类使用量仅增长 2.8 倍,其中 70% 的 Agent token 来自缓存提示词。Agent 在选择模型时越来越看重成本、延迟和可靠性。
英伟达服务器涨价15%. 内存短缺正推动英伟达 AI 服务器价格上涨逾 15%,涉及 Vera Rubin 和 Grace Blackwell 系统,原因是三星、SK海力士和美光的 DRAM 成本上涨,影响了云计算巨头和 AI 实验室。
英伟达获Poolside许可. 英伟达将向 Poolside 投资 10 亿美元,并支付 60 亿美元以获得其技术授权,同时将 100 多名工程师调往 Nemotron 项目,旨在与中国开放权重竞争。
AI经理解雇员工. 自 4 月起在旧金山一家门店运营的 AI agent Luna,因一名人类员工多次迟到而将其解雇,但这是在人类提醒它注意自身规则之后才发生的。用七个模型进行回放显示,能力更强的 AI 会更一致地建议解雇。
Claude token灰色市场. 中国开发者通过中转站绕过 Anthropic 的限制,这些中转站以约官方价 10% 的价格出售 Claude token,并使用海外服务器、免费额度和模型替换等手段,削弱了地理封锁与安全监控。
今天的内容就这些 - 大约5分钟阅读。