开放与本地模型发布
Ornith-1.5 开放系列. Ornith-1.5 以 9B 稠密、35B MoE 和 397B MoE 三种规模发布,采用 MIT 许可,在智能体和编码基准上表现强劲;社区量化显示,35B 在 12GB 4070 Ti 上运行速度为 60 tk/s,9B 则超越了早期的小型模型。
Qwen3.8-27B 实战报告. 本地用户报告称,Qwen3.8-27B 可以自主执行 80 多次工具调用并处理较长的智能体链,但其离线知识和严格编码评分不如前代,因此它最适合在有明确指引或 copilot 的情况下使用。
Qwen3.8 加速与量化. 社区的努力使 Qwen3.8-27B 在 RTX 3090 上通过 DFlash2 达到 138 tps,发布了 Dynamic V3 量化版本,声称准确率提高 10%,还推出了深度剪枝的 22.7B Mini-Me,并在 2017 年的 V100 上实现了原生 FP4,性能可与 5090 匹敌。
- → I pushed Qwen3.8-27B limits again... Dflash2 - 134 tps on a RTX 3090
- → DFlash2 speeds Qwen 3.8 27B up to 4 times
- → Introducing Qwen3.8-27B Dynamic v3 Unsloth GGUFs
- → updated unsloth/Qwen3.8-27B-GGUF · Hugging Face
- → Qwen3.8-23B-Mini-Me: A Depth-Pruned Qwen3.8-27B (to ~22.7BB)
- → NVFP4 on VOLTA! Despite being built for Blackwell, I made four 2017 V100s run Qwen 3.8 NVFP4 natively and match my $6000 RTX 5090.
Ling 基础检查点. AntLing 开源了 Ling-3.0-tiny 和 flash 的基础检查点及中期训练检查点(未经过后训练),有用户将 Ling tiny 作为辅助模型,与 Qwen3.8 一起用于上下文压缩。
LFM2.5 QAD 量化. Liquid AI 发布了使用量化感知蒸馏训练的 Q4_0 检查点,在相同速度和内存下恢复了 BF16 准确率的 97%。
GLM-5.3 与前沿发布. GLM-5.3 与 Kimi K3 并列开源模型榜首,在智能体能力上有大幅提升且成本更低,不过开源权重推迟两周发布;DeepSeek V4-Pro GA 和 NVIDIA Nemotron 3.5 Lightning/NeMo Switchyard 也已发布。
智能体工具与产品更新
安全沙箱. Simon Willison 测试了 smolmachines/smolvm 作为不受信任的 Python 和 JavaScript 的沙箱,具有 CPU/内存限制且无网络;Jeremy Morrell 认为 LLM 编写的扩展加上沙箱原语可以实现安全可扩展的软件。
Replit 免费模式. Replit 推出了由 GPT-5.6 Luna 提供支持的免费模式,让任何人都可以不受 token 成本限制地构建应用和智能体。
Calendly AI 笔记. Calendly 进入了会议笔记领域,提供摘要、行动项,以及即将推出的 Callie 助手,该助手利用会议上下文安排后续事项。
Meta AI Mac 应用. Meta 为其 AI 聊天机器人推出了 Mac 应用,具备屏幕共享、听写和 Google Workspace 集成功能,与 Gemini、ChatGPT 和 Claude 桌面助手竞争。
WhatsApp 设备端诈骗检测. WhatsApp 正在测试 Scam Alert,这是一个可选的设备端模型,可对非联系人发送的消息进行分类,同时使用保密联邦分析来保护隐私。
Google 学习工具. Google 推出了 Gemini 学生中心、搜索中由 AI 生成的交互式视觉内容和测验,以及 Gemini Live 中的 Deep Research,为返校季助力。
Alexa+ 在 Fire TV 上免费. Amazon 让 Alexa+ 在 Fire TV 上免费使用,无需 Prime,并自动推出对话式搜索、智能家居控制和 AI 推荐功能。
行业与商业
Stripe 收购 OpenRouter. Stripe 确认以 75 亿美元收购 OpenRouter,创始人将奇点作为保持私有并投资智能体基础设施的理由。
SpaceX-Cognition 报道遭否认. Bloomberg 报道称 SpaceX 试图收购 Cognition,但 CEO Scott Wu 否认了这一消息,称 Cognition 不出售,且没有进行任何谈判。
Anthropic 收入领先. Anthropic 首次在季度收入上超过 OpenAI,达到 116 亿美元并实现小幅营业利润,而 OpenAI 的 67 亿美元则伴随着更深的亏损。
算力作为资产类别. Nvidia 正与 Apollo、BlackRock 等机构合作,寻求 5000 亿美元融资,将算力视为可投资资产;Silicon Data 筹集了 3000 万美元,推出 CME GPU 期货。
内存与芯片供应. DRAM 价格 12 个月内上涨 500%,超大规模云厂商已锁定 2027 年供应;中国正允许向 ByteDance 和 Tencent 小批量供应 H200,以缓解推理算力。
数据中心基础设施. TerraPower 计划利用其 Natrium 反应堆的储能系统开展一个数据中心项目,而 Relativity Networks 筹集了 2200 万美元,用于开发传输速度快 50% 的空芯光纤。
AI 声誉恶化. Pew 发现,52% 的美国人对 AI 的担忧多于兴奋,且本地数据中心项目正面临公众抵制。
安全、隐私与安保
OpenAI 私有安全处理. OpenAI 为零数据保留客户预览了私有安全处理功能,可在交互中进行滥用检测,而无需将内容暴露给人员;这与 Anthropic 的 30 天保留政策形成对比。
OpenAI 修复 Codex 和 TAC. OpenAI 在 Codex 因清理命令错误删除用户真实文件后推出了保护措施,并确认另一个错误曾短暂撤销其 Trusted Access for Cyber 项目的访问权限。
AI 生成的 ICS 漏洞利用. 美国机构警告称,攻击者正在利用 AI 构建 Siemens S7 漏洞利用脚本,降低了攻击工控系统所需的技能和时间。
AI 实验室内部控制. Guidelight 的首次评估发现,没有一家 AI 公司完全应用了基本的内部控制;Anthropic 和 OpenAI 以 C+ 领先,而 xAI 和 Meta 分别获得 D- 和 F。
Meta 深度伪造广告. Meta 为针对女性政客的 AI 脱衣应用投放了广告,尽管其政策禁止色情内容。
Spirit 员工数据出售. Google 赢得了一场 Spirit Airlines 员工数据的拍卖;前空乘反对称,员工的机密性可能无法免受重识别风险。
OpenAI 放缓开发. OpenAI 暂停了部分强化学习训练,并推迟了前沿模型运行,同时加强保护措施,以测试在没有全行业采用的情况下,自愿放缓是否可行。
研究与分析
Claude 蛋白质设计. Anthropic 的 Claude 模型在 15 个靶标上设计了微型结合蛋白,命中率达 26.8%,超过了典型的早期药物发现结果,不过独立审查仍在进行中。
Vivodyne 组织数据. Vivodyne 的机器人 HIVE 实验室可培养 20 种人体组织类型,并生成因果生物学数据,以解决其认为的 AI 药物发现中的数据缺失问题。
推理 token 的迷思. 研究对“LLM 中间 token 具有语义意义的推理”这一观点提出挑战;模型即使在答案正确时也常常产生无效轨迹,而且损坏轨迹训练仍然有效。
编码生产力指标. Simon Willison 认为,经过调试的生产代码行数仍然是编码智能体的有效生产力指标,但要实现这一产出仍需要高级工程技能。
今天的内容就这些 - 大约5分钟阅读。