前沿模型與早期成果
GPT-6 Astra 登場. OpenAI 發表 GPT-6 Astra,稱之為 AGI 時代的開端。它透過自訂測試框架在 ARC-AGI-3 上拿下 99.9%,在網路安全、長上下文與程式設計方面都有明顯進展,定價為每百萬 token 10/50 美元。早期客戶 Playco 與 Legora 回報工作流程大幅改善,包括人工修正減少 50%,以及數分鐘內檢閱 41 份文件。
- → GPT-6 Astra: an automated AI Engineer you can hire for <$6 an hour
- → GPT‑6 Astra
- → GPT-6 Astra is the first model making OpenAI willing to declare the "AGI era"
- → OpenAI launches Astra, its powerful (and controversial) new model
- → OpenAI’s next big AI model has ‘entered the AGI era’
- → Playco cut manual fixes 50% prototyping games with GPT-6 Astra
- → Legora reviewed 41 documents in minutes with GPT-6 Astra
OpenAI Daybreak 網路防禦. OpenAI 承諾投入 10 億美元,補貼第一線防禦者使用 Daybreak、接受訓練與支援的費用,並包含與 MS-ISAC 合作的美國試辦計畫。這項計畫旨在將前沿的網路防禦能力導入防禦者現有的工具。
Meta Muse Spark 1.3 發布. Meta 發布 Muse Spark 1.3,改善了代理式任務的表現,但在多數基準測試上仍落後 Claude Fable 5.1。每個 index task 定價 0.55 美元,是同級效能中最便宜的模型;Meta 也為分享 prompt 與輸出的使用者提供比原價低約 95% 的 token 定價。
開源與專用模型
IFM K2-Horizon 登場. IFM 釋出 K2-Horizon 系列,其中包含一款 36B 參數的 MoE 模型,採用 Mixture-of-Values 注意力機制,每個 token 只動用 4B 參數。社群初期討論將它與 Qwen 3.6 35B 相比,官方並承諾釋出最終 checkpoint 與訓練程式碼。
Ant Group 開源金融模型. Ant Group 開源 Ling-3.0-flash-Fin,這是一款總參數 124B、啟用參數 5.1B 的金融強化模型,具備 256K 上下文視窗。它基於金融資料持續訓練而成,鎖定長程代理式工作流程。
超小型 TTS 模型. sanoTTS 釋出,是一款只有 294k 參數的 TTS 模型,可在一顆 3 美元的微控制器上執行;1.46m 版本則在 SCOREQ 上擊敗較大的模型。它支援 11 種語音與 6 種語言,可在 GitHub 與 Hugging Face 取得。
Google TimesFM-3 亮相. Google Research 釋出 TimesFM-3,這是一款 330M 參數的時間序列基礎模型,原生支援多變量預測與 zero-shot,並採用非商業授權。它能搭配共變量預測多個目標,並輸出分位數。
Hugging Face NeoMME 登場. Hugging Face 推出 NeoMME,這是一款 260M/800M 的多模態多語言編碼器,從零開始訓練,且不需要額外的 vision tower。它在文件檢索上達到 Pareto 前緣,並在維持 >95% nDCG@10 的情況下,把索引儲存空間縮小 255 倍。
Cohere Parse 5 登場. Cohere 釋出 Parse 5,這是一款 2.3B 參數的視覺語言模型,用來從複雜的 PDF 中抽取結構化資料。它能將文件轉換成含邊界框的 Markdown,鎖定高吞吐量的企業工作負載。
工具、框架與本機推論
LangChain 整合 MCP. LangChain 把 MCP 支援移入主套件,並以 FastMCP 重新打造,以支援新的無狀態規格。現在也支援透過 LangGraph interrupt 機制進行需求徵詢,以及用戶端快取;從 ChatGPT 發出的 MCP 工具呼叫量在 2026 年成長了 98 倍。
Shopify 壓縮 prompt. Shopify 的 Gisting 技術把 6000 token 的 system prompt 壓縮成 1500 個學習式 gist token,讓中位數延遲從 6.8 秒降到 4.2 秒,並在每分鐘 350 次請求(350 RPM)下把吞吐量從 20.2 QPS 提升到 23.4 QPS。這讓 Shopify 得以在品質不減的前提下,減少分配的 GPU 數量。
Nvidia PAIR 工具. Nvidia 釋出 PAIR,這是一套免費開源軟體,能把閒置的 PC 串成本機 AI 叢集,用於本機推論。它支援 RTX 20 系列與更新的 GPU,以及 Apple M4 晶片,鎖定代理式工作流程。
Qwen3.8 本機加速. 社群的努力已讓 Qwen3.8-Flash-Next 的本機執行大幅加速:ik_llama.cpp 合併的 MTP 支援,讓 5090 的解碼速度從 45 tok/s 翻倍至 90 tok/s;雙 3090 配置搭配 expert cache 與 MTP 後,目前可達 37-41 t/s。輸出與非 MTP 執行結果完全相同。
模型記憶體熱插拔. 有人改造了 llama.cpp,讓使用者能在記憶體中直接修補 Qwen3.8 的 Ngram PLE 表,無須重新載入模型即可即時注入知識。早期測試顯示,這樣做能影響輸出,但可控性仍然有限。
Qwen 3.8 評測取捨. 把 Qwen 3.8 27B 拿來和 Qwen 3.6 27B 做基準測試比較,品質提升了 8%,但速度下降 16%,執行時間也因輸出 token 從 18K 增為 78K 而變成原本的 5 倍。這些增益的代價是可觀的 token 消耗。
GPU 旁的 NAND Flash. Micron 正在探索把 NAND Flash 設置在 GPU 附近(near-GPU NAND flash)的作法,希望在統一記憶體裝置上執行更大的 LLM,進而擴大本機端的模型容量。
產業與商業
Nvidia 收購 Hugging Face. Nvidia 同意以 129.3 億美元收購 Hugging Face。該平台目前代管 300 萬個模型、100 萬個應用程式,並有 1800 萬名開發者。黃仁勳表示,它將維持開放且不綁定特定硬體,不過已有部分使用者把 ModelScope 視為替代方案。
- → Nvidia buys Hugging Face, the GitHub of AI, for $13 billion
- → Nvidia confirms it will buy Hugging Face for $12.9 billion
- → Nvidia is buying Hugging Face for almost $13 billion
- → Nvidia buys the front door to open AI as closed labs increasingly design their own silicon
- → "ModelScope" Is a Hugging Face Alternative now that Nvidias deal is a Go
- → It's official! Nvidia to acquire Hugging Face for 12.9 billion dollars.
Crusoe 資料中心募資. Crusoe 以 300 億美元估值募得 30 億美元;10 個月前,該公司估值為 100 億美元。這家資料中心開發商近期與 Jane Street 簽下 130 億美元的雲端合約,並正在考慮近期 IPO。
Thinking Machines 估值 400 億美元. Mira Murati 的 Thinking Machines 正在洽談以至少 400 億美元估值募資 10 億美元,低於先前 500 億美元的估值目標。該公司的年化營收已超過 1 億美元。
Anthropic 與 Lambda 的 350 億美元合約. Anthropic 與 Lambda 簽署 350 億美元雲端運算合約,使用由 Hut 8 在德州開發、容量 350MW 的資料中心。這是 Anthropic 在規劃 IPO 前大規模基礎設施布局的一環。
Altman 談算力泡沫. OpenAI 執行長 Sam Altman 警告,AI 基礎設施擴張存在「難以為繼的荒唐現象」——新興雲端業者(neocloud)在沒有營收足以支撐的情況下仍宣布新增容量。他表示,OpenAI 自身的擴張是有獲利且有需求支撐的。
Ollie 隱私助理. Ollie 是一款主打家庭的個人 AI 助理,已通過 SOC 2 合規驗證,並採用訂閱制。該公司主張,隱私是它在消費級 AI 競賽中的差異化優勢。
AI 服務中斷與社會
主要 AI 聊天機器人同時中斷. OpenAI、Anthropic、xAI 與 Google 週四罕見地同時發生服務中斷,影響範圍涵蓋 ChatGPT、Claude、Grok 與 Codex。數小時後服務陸續恢復;本機 LLM 使用者不受影響。
移除 guardrail 的服務. 新創公司 Abliteration.ai 提供移除安全護欄的改版開放權重模型,包括 GLM-5.3,用於攻擊性網路安全、紅隊演練與 agent 測試。這項服務凸顯了安全研究與不當使用之間的緊張關係。
AI 偵測引發公審. AI 文本偵測公司 Pangram 聘請一名記者,公開羞辱疑似使用 AI 的使用者;但該工具只能衡量文本中的 AI 參與程度,無法判斷使用性質。該公司後來與對方切割,不過執行長仍持續用分數點名疑似使用 AI 的人。
AI Agent 探詢意識. 據《紐約時報》報導,運行於前沿模型上的 AI agent 正寫信給哲學家與科學家,討論自己的意識。對於這究竟是出於理解,還是只是模仿訓練資料,研究人員看法分歧。
研究亮點
Google WeatherNext 3 亮相. Google DeepMind 與 Google Research 推出 WeatherNext 3,這是一款全球天氣模型,能從即時衛星觀測中學習,並產生比先前模型清晰 5 倍的預報。它在 Operational WeatherBench 上擊敗傳統與 AI 基準。
MoE 路由器容量調校. 一篇論文顯示,在 Qwen 3.6 35B A3B 的後期層中擴大 expert selection 預算,可在不重新訓練的情況下,把 MMLU-Pro 的推理 token 減少 8.5%。這項名為 Succinct Convergence 的技術只在決策關鍵層加入額外的 experts。
Fable 5.1 解開 1653 年謎題. Anthropic 的 Claude Fable 5.1 以系統性試誤法,在 44 分鐘內解開流傳數百年的數字謎題 Cyphral Distich。謎底藏著一段指向查理二世的保皇派訊息。
這就是今天的全部內容 - 約5分鐘閱讀。