Agentic AI News 今天

一天AI代理新聞,5分鐘讀完:發佈、工具、研究、募資和企業動態。

每日更新 精選自 30 個來源 星期四, 十月 8, 2026

模型與介面

Claude Haiku 5.5. Anthropic 新推出的快速低價模型提供 100 萬 token 上下文,10 萬 token 以內的 prompt 價格降到每百萬 token 0.10 美元,與 GPT-6 Luna 相當;但它的 tokenizer 會多算約 25% 到 30% 的 token,超過 10 萬 token 之後價格跳到 5 倍。基準測試顯示,它比 Haiku 4.5 大幅躍進,在 agentic coding 上也很有競爭力。

Mistral Large 4「Le Chonk」. Mistral 以預覽版發布 1 兆參數的開放權重模型,針對程式開發、資安防禦與特定產業最佳化,並聲稱能力已接近美國與中國的前沿模型。

Liquid AI 決策模型. Liquid AI 開源 d1-3B 與 d1-omni-600M,這兩款多模態決策模型能以零輸出 token 回傳校準過的 yes/no、選項或分數答案。d1-3B 宣稱在 Decision Index 的 10B 以下級距表現最佳,在 NVIDIA Jetson 硬體上最快 16 毫秒就能執行,另外也出現了 WebGPU 瀏覽器版本。

OpenAI Decisions API. OpenAI 推出 beta 版 Decisions API,可對文字或圖片做 yes/no、分類與評分刻度評估,速度約比 Responses 快 10 倍。它支援 GPT-6 Luna,輸入每百萬 token 0.10 美元,輸出 token 免費。

ChatGPT 智慧介面. 搭配 GPT-6,ChatGPT 能輸出互動式圖表、按鈕、表單與迷你應用,不再只有純文字。OpenAI 表示推理會在思考階段就開始,以縮短等待時間;付費用戶可使用 GPT-6 Sol,免費用戶則使用 Luna。

Kandinsky 6.0 影片生成. Kandinsky Lab 發布 Kandinsky 6.0 Pro(29B)與 Lite(3B),支援 ComfyUI 與 Diffusers,並新增影片 upscaler。

Nemotron 競賽成果. 經過微調的 Nemotron 模型在 IOI 2026 拿下金牌水準的非官方成績(535.4/600),並在 IMO 2026 以 30/42 的官方成績摘金,方法結合 SFT、RL 與 generate-verify-refine。

AI 代理與框架

Nous Research 企業代理. Nous Research 以 15 億美元估值募得 9,000 萬美元,並推出 Hermes for Businesses,瞄準企業級 AI 代理。其開源 Hermes Agent 已被 clone 2,400 萬次,推估占全球 AI token 使用量的 2.5%。

LangChain Deep Agents. LangChain 推出 Skills 更新,把工具綁定到 skill 上以縮小上下文,另外發表 Managed Deep Agents v0.9,支援由 agent 自行建立排程、每次執行各自的設定,以及 Slack 表情回應。

Copilot 跨 Windows 代操. 微軟的 Hybrid Intelligence 將讓 Copilot 能存取本機檔案,並在 Windows 中代使用者執行動作,例如尋找、重新命名、壓縮檔案,或把文件寄出。

Meta Muse 登陸 iPad. Meta 的代理助理 Muse 在安裝數達到 660 萬次後,推出原生 iPad 支援,並新增 Canva、GitHub、QuickBooks 等工具的連接器。

Agent Lightning RL. Microsoft Research 開源 Agent Lightning v1.0,這是一套 3,500 行的 agentic RL 框架,使用真實部署的 harness 與原生 Kubernetes。在一項範例中,它用約 6,000 筆訓練樣本,把 Qwen3.5-9B 在 SWE-bench Verified 的 Pass@1 從 41.8% 提升到 56.4%。

地端 AI 與開發工具

ROCm 10.1. AMD 的 ROCm 10.1 針對地端推論的資料搬移瓶頸下手,版本發布後在 Reddit 上引起地端 AI 使用者討論。

llama.cpp 加速 MoE. llama.cpp 加入針對存放於主機記憶體的 MoE 專家權重的 GPU 快取,對於無法完整塞進 VRAM 的模型可望大幅加速,同時新增 GLM5Next MTP 支援。

Unsloth Studio 加強 repo 檢查. Unsloth Studio 現在執行前會重新檢查受信任的模型 repo;此前 PyPI 上出現遭篡改的 LiteLLM 版本,顯示供應鏈攻擊也能觸及 AI 工具。

雙 GPU 跑 GLM-5.3-Flash. 一套搭載兩張 CMP 170HX 64GB 的配置,以 EXL3 執行 GLM-5.3-Flash,上下文達 384K、速度約每秒 90 個 token;這款 320B MoE 把作用中的權重留在 HBM,並與 Qwen3.8-Flash-Next 進行評測比較。

地端 Qwen 評測. 近期社群評測把 Qwen3.8-27B 微調版與 Qwen3.8-Flash-Next,拿來與前沿模型在特定領域與程式任務上比較。一份 469 題的評測發現,地端模型在兼顧隱私與較低成本下,表現已能接近前沿模型,不過 thinking token 用量過高仍是問題。

硬體與 Windows

Surface AI 硬體. 微軟發表 Surface Laptop Ultra 與 Surface RTX Spark Dev Box,兩者都採用 Nvidia 以 Arm 架構為基礎的 RTX Spark 晶片。Laptop 售價自 2,599 美元起,統一記憶體最高 128GB,10 月 16 日出貨;Dev Box 售價自 5,999 美元起,鎖定執行 120B 以上的地端模型。

產業與商業

AI 程式碼理解落差. 一份針對 300 位資深工程主管的調查發現,AI 程式開發代理把瓶頸轉移到除錯與理解:團隊現在每週花 9.8 小時寫程式,卻要花 16.9 小時除錯。報告點出關鍵任務程式碼庫的風險正在升高。

虛擬細胞計畫. Biohub 正在協調一項 18 億美元的計畫,要打造能預測細胞行為的 AI 模型。Google DeepMind、Meta 與 Isomorphic Labs 投入 3 億美元,美國能源部(DOE)則出資逾 5 億美元,用於實驗室量測與算力。

Adobe 工具開源重製版. 開發者 Brandon Thomas 用 Claude Opus 5.5 打造 Artcraft,這是一套七款以 Rust/WebAssembly 寫成的開源應用,分別複刻 Adobe 的 Photoshop、Illustrator、Premiere 等產品。這些應用還在早期階段,仍有許多不足,但計畫展示了 AI 輔助的 clean-room 重實作。

SynthID 偵測器開放. Google 向大眾開放 SynthID 偵測器,任何人都能檢查圖片、影片與音訊是否帶有 Google 或合作夥伴的浮水印。這套系統已標記超過 1,800 億件媒體內容,也內建於 Chrome 與 Gemini。

Google Playground 做遊戲. Google Labs 推出 Playground,這是個瀏覽器平台,美國成年使用者可用文字提示生成遊戲,背後由 Gemini、Nano Banana 與 Lyria 驅動。Unity 也發表 Unity Spark,鎖定專業的 AI 輔助遊戲開發。

這就是今天的全部內容 - 約5分鐘閱讀。

每天早上在瀏覽器中閱讀

此擴充功能在Chrome側邊欄中開啟摘要 — 一鍵點擊,無需帳戶。

新增至 Chrome — 免費