模型发布与基础设施
Nvidia 的速度优先模型. Nvidia 发布了 Nemotron 3.5 Lightning,这是一款开放权重的 30B Mamba-Transformer 模型,在基准测试上与 GPT-OSS-120B 相匹配,同时针对快速推理进行了优化,仅有 3.6B 活跃参数。
DeepSeek V4 本地运行. DeepSeek V4 的社区量化版本修复了位精确基线的转换问题,DeepSeek V4 Flash 在 Strix Halo APU 上通过推测解码实现了 27+ t/s,展示了可行的本地部署。
Unsloth 桌面应用. Unsloth 发布了一款开源桌面应用,用于在 GPU 上运行和训练本地模型,具有沙盒代码执行、RAG、模型导出和无遥测功能。
River AI 的 11 亿美元种子轮. 由前 xAI 联合创始人 Igor Babuschkin 创立,River AI 筹集了 11 亿美元,通过重新思考从训练到硬件的整个技术栈,构建个人可训练的 AI 助手。
Daybreak Cyber 登陆 AWS. OpenAI 的 Daybreak 网络安全模型现可通过 Amazon Bedrock 获取,使防御者能够在现有 AWS 环境中使用前沿网络能力。
扎克伯格的开源宣言. Meta 首席执行官主张更开放权重的发布,并邀请政府合作进行安全测试,同时该公司继续发布像 Muse Glimmer 这样的模型。
Ling-3.0 支持. 一个拉取请求将 Ling-3.0 添加到 llama.cpp,其小型变体已经在家庭助手语音任务中表现良好,因为它在不确定时会诚实拒绝。
工具与本地 AI
MCP 代理削减上下文. 一个 DIY 代理工具使用 MCP 代理将工具隐藏在代理后面,将启动上下文从 20K tokens 削减到几乎为零,并增加了时间感知以确保更好的本地执行。
用矿卡运行 LLM. 8GB CMP170HX 矿卡可以扩展到每张 64GB,可同时运行大型模型或多个小型模型,提供廉价但老化的 Ampere 级性能。
V100 上 366 t/s. 自定义 CUDA 内核(v100-skinny)在 Volta GPU 上通过 NVFP4 实现了 Qwen3.6 27B 高达 366 t/s 的速度,为旧硬件进行本地推理注入了新的活力。
TinyTitle 模型. 一个 1.8M 参数的 GRU 模型在不到 5 MiB 内存中生成聊天标题,展示了在几毫秒内运行的超轻量设备端摘要功能。
私有电子书阅读器 AI. 一款电子书阅读器应用本地集成 Gemma 4B 模型,用于私密的应用内图书问答,具有剧透开关和自动语言匹配功能。
低功耗 AI 服务器. 将 Intel N100 与 RTX 5060Ti 结合构建,产生了一个安静高效的 llama.cpp 服务器,能够运行像 Qwen 3.5 这样的最新模型,适合日常使用。
推理成本大幅降低. Doubleword 的首席执行官解释了如何为非实时使用设计推理栈,与通用设置相比,可以将 token 成本降低一个数量级以上。
智能模型路由. NVIDIA 的 Switchyard 库仅将 7% 的代理调用路由到前沿模型,将成本降低 74%,且准确性损失极小,并提供了评估成本效益的公式。
私有 AR 眼镜. 一位盲人用户要求使用运行本地模型的 Meta 风格 AR 眼镜,以避免将视觉数据发送给 Meta,突显了辅助技术中的隐私需求。
前沿研究
AI 攻克黎曼猜想. 一个未发布的 Anthropic 模型通过 60 个子代理在 36 小时内测试了 650 个想法,在黎曼猜想上取得了进展,重新引发了关于 AI 在数学发现中作用的争论。
AMIE 的视频诊断. Google 的 AMIE 研究系统展示了专家级的临床视频咨询,使用 Gemini 和多代理设置来解读视觉、听觉和情境线索。
CARE-X 胸部 X 光 AI. Microsoft 的 CARE-X 是一个统一的胸部 X 光 VLM,结合了生成和结构化预测,使用强化学习来奖励临床正确性。
代理记忆对决. ACE 和 ALTK-Evolve 都将代理轨迹转化为可复用的经验;ACE 构建了全面的战术手册,而 ALTK-Evolve 则检索个别指导方针。
Logprobs 检测幻觉. 在思维链中第一次事实回忆时分析 token 概率分布,可能会揭示不可靠的知识,提供潜在的早期幻觉信号。
AI 写作警示. S. Alpert 认为没有重写是无损的,因此 AI 辅助的文本必须经过个人验证,以避免扭曲作者的预期含义。
商业与金融
10 亿用户里程碑. ChatGPT 和 Gemini 均达到 10 亿月活跃用户,其中 Gemini 是 Google 最快达到该规模的产品;ChatGPT 今年早些时候已达到 9 亿周活跃用户。
ChatGPT 广告走向全球. OpenAI 将 ChatGPT 广告扩展到另外五个国家,报告称对用户信任没有影响,且关闭率低,以寻求可持续的变现方式。
OpenAI 涨价. 新的 ChatGPT Business Premium 席位费用为 125 美元/用户/月,容量为五倍且无每小时限制,反映了代理工作负载的高 token 使用量。
Lightcap 离职. Brad Lightcap,OpenAI 前首席运营官和特别项目负责人,在任职八年后离职去开创一番新事业,延续了一系列高管离职潮。
Anthropic 的 91 亿美元租约. Anthropic 与比特币矿商 Riot Platforms 签署了一份为期 20 年、价值 91 亿美元的数据中心协议,在德克萨斯州获得 191 MW 电力,计划从 2027 年开始为其下一代模型供电。
Anthropic IPO 障碍. 在可能进行的 9650 亿美元 IPO 之前,投资者质疑 Anthropic 在廉价中国模型和政治逆风中的增长,尽管该公司宣扬未来的健康和生物学应用。
Nvidia 的 5000 亿美元推动. Nvidia 与六家金融公司合作,通过保证其芯片高达 25% 的残值,调动 5000 亿美元用于 AI 基础设施,以应对折旧担忧。
Accel 对印度 AI 的押注. Accel 完成了一支超额认购的 5.5 亿美元印度基金,押注 AI 将支撑消费、金融科技和制造初创企业,而不是作为一个独立的类别。
OpenAI 员工套现. 在 8520 亿美元估值下进行的 70 亿美元股票回购,让现任和前任 OpenAI 员工得以变现股票,缓解了潜在 IPO 前的压力。
安全与透明
欧盟强制要求 AI 水印. 根据欧盟《人工智能法案》,Anthropic 和 OpenAI 承诺对生成内容进行标记;Claude 将在文本和图像中嵌入隐形水印,并正在为旧模型提供支持。
苹果照片溯源. iOS 27 可能会引入“Apple Reference Image”,在拍摄时嵌入溯源元数据,让用户证明 iPhone 照片不是深度伪造。
Spotify 标记 AI 艺术家. Spotify 将标记 AI 生成的艺术家资料,并将其排除在推荐之外,在 9 月中旬推出该变化之前,将同时使用自我披露和检测手段。
AI 写作争议. 游戏工作室 Saber 否认在 Rideshare Stimulator 中使用 ChatGPT 替代编剧,但前首席编剧声称 AI 被用于写作和配音,且未在 Steam 上披露。
AI 驱动的 Zoom 漏洞利用. 一个严重的 Zoom 漏洞允许通过其注释功能接管设备,该漏洞仅通过不到 20 次提示公共 AI 模型就被发现,展示了 AI 加速的安全研究。
推理轨迹窃取. 研究人员将来自前沿模型的加密思维链 token 重放到能力较弱的同类模型中,成功越狱并恢复了隐藏的推理过程,在公共会话中暴露了密码和 API 密钥。
信任 AI 生成的代码. IBM 和 Red Hat 扩展 Lightwell,为 AI 时代创建可验证的软件供应链,确保人力和 AI 生成代码的来源和策略合规。
今天的内容就这些 - 大约5分钟阅读。