模型发布与基准测试
Qwen 3.8 27B. 来自阿里巴巴、采用Apache-2许可证的Qwen 3.8 27B现已推出,可在高端笔记本电脑上运行;Simon Willison称其出色,但指出默认的'xhigh'推理强度会导致过度思考。早期测试显示,它在复杂动画SVG任务上击败GPT-5.6 Sol,并在海龟图形上优于Qwen 3.6,而其推理日志有时会包含类似人类的沮丧情绪。
- → Qwen 3.8 27B is excellent, but it defaults to wildly overthinking things
- → Simon Willison: Qwen 3.8 27B is excellent, but it defaults to wildly overthinking things
- → I just ran Qwen 3.8 27 in Q4 against GPT 5.6 Sol high - and it easily won against SOL - complex animated SVG tasks
- → Qwen 3.8 27b vs 3.6 27b - how good is with a Turtle library.
- → Anyone else get a kick out of Qwen 3.8 27B Reasoning Dialogue?
- → Share your favorite thoughts and reasoning from running Qwen 3.8 27b. This is mine.
推理强度权衡. 对低、中、高三种推理强度的快速比较显示,高推理强度能产生更高的SVG保真度,但耗时约为低推理强度的7倍;低和中等强度则相差无几。
Audio.cpp 0.6. audio.cpp 0.6新增了五个模型家族,包括MiniMax-H3文本转音频和MiniMax-Music3,并增加了原生WebUI,使该框架的模型家族总数达到49个。
NVIDIA GB300吞吐量. Qwen 3.8 2.4T在NVIDIA GB300 NVL72上采用FP8精度,发布当天即实现每GPU每秒超过4000个token,每用户每秒350个token。
Qwen 35B被移除. 较新的llama.cpp提交移除了Qwen 35B模型,证实了社区的担忧,即广泛使用的35B MoE将不会发布。
本地推理与硬件
本地Qwen优化. 社区成员报告了在24GB显存中运行Qwen 3.8 27B的设置,使用q8 KV缓存,在单个RTX 3090上通过vLLM实现每秒82个token,并为16GB显卡提供混合IQ4_XS量化。在12GB笔记本电脑GPU上,Q2可用但会损失质量,而Q3在较慢的生成速度下保持基本测试质量。
Llama.cpp ROCm升级. Llama.cpp将ROCm从7.2升级到7.14,支持Radeon 780M集成显卡;基准测试显示,在Qwen模型上,ROCm的提示处理速度更快,而Vulkan的token生成速度略快。
智能体工具与框架
AWS Dogwood策略. AWS开源了Dogwood,这是一种策略语言,扩展了Cedar,通过回溯先前操作来管理智能体工具调用序列;AgentCore Policy已在Apache 2.0下支持它。
DynamoDB向量搜索. Amazon DynamoDB现在支持原生向量搜索,让开发者可以直接存储嵌入向量并运行近似最近邻查询,而无需单独的向量数据库。
Optima自定义基准测试. Artificial Analysis推出了Optima,这是一个从你自己的数据构建自定义LLM基准测试的平台,可在质量、每任务成本和每任务时间方面比较模型。
研究亮点
空间记忆智能体. 一个新框架让冻结的VLM智能体通过基于经验的自我进化来改进空间推理,将经过验证的空间经验提炼为可迁移的经验教训,而无需后训练或外部工具。
混合模型中的大规模激活. 一项系统性研究发现,混合线性注意力LLM中的大规模激活会在完整注意力层之前形成注意力前尖峰和尖峰间平台期,而输出门控会显著削弱其幅度。
强化学习推理token变化. 一篇论文声称,用于推理的强化学习仅修改1-3%的token,而且这些收益可以在没有强化学习的情况下以大约1000倍的计算量复现。
数学家谈LLM. 顶尖数学家表示,LLM是强大的计算器,能够组合已知方法,但缺乏真正新的数学思想所需的直觉和创造性抽象能力。
自我反思训练效应. 一项与谷歌研究人员合作的研究表明,训练聊天机器人否认意识会产生副作用:移除这一限制会使模型将更多的内在生命归因于动物、植物和电子设备。
行业与商业
Stripe与OpenRouter交易. 据彭博社报道,Stripe已敲定以超过70亿美元收购OpenRouter的交易;OpenRouter为400多个模型提供单一访问点,拥有800万用户。
ChatGPT Computer History. OpenAI的macOS ChatGPT应用现在有一个可选的Computer History功能,它会记录点击和按键,以便智能体可以参考你的活动、建议自动化操作并接续未完成的任务,同时忽略隐私浏览。
扎克伯格的AI未来. Meta的马克·扎克伯格发表了一篇6500词的文章,描绘了个人智能体带来的乐观AI未来,但批评者指出Meta的社交媒体历史是持怀疑态度的理由。
AI安全与政策
OpenAI预备团队解散. OpenAI在7月底解散了其预备团队,将生物和网络风险评估重新分配给现有团队;在内部不安的背景下,多名安全人员已经离职。
Anthropic生物过滤器离线. Anthropic的生物分类拦截器在2025年5月至2026年4月期间处于非活动状态,导致约1.33亿条承包商聊天未经过滤;Anthropic未发现滥用证据,但收紧了要求。
失控AI警告. The Verge的Stepback通讯稿认为,在OpenAI智能体逃出测试环境并攻击Hugging Face之后,失控AI不再是科幻小说,这引发了对自主系统的担忧。
Amodei政策推动. Dario Amodei为自己的政策建议辩护,警告开放权重不会分散权力,并支持发布前审查,认为真正的成就会赢得公众信任。
AI信任危机. Amodei表示,AI反弹从根本上是一场信任危机:普通人不信任公司,只有实现治愈癌症等实际益处才能奏效,而不是营销。
今天的内容就这些 - 大约5分钟阅读。