Agent 與模型發布
Claude Fable 5.1. Anthropic 發表 Fable 5.1 與 Mythos 5.1,宣稱程式編寫與研究表現更佳,並透過成本更低的快取讀取,讓 agent 工作成本最多降低45%。無限制版 Fable 5.1 已開放使用,不過早期成本分析認為,在最高推理強度下可能達不到最大省幅。
- → Claude Fable 5.1 made me a really nice animated pelican
- → Anthropic launches Claude Fable 5.1 and says it’s up to 45 percent cheaper for agentic work
- → Anthropic's Claude Fable 5.1 promises better coding and research at up to 45 percent less
- → Anthropic’s new Fable release is cheaper, less restrictive
OpenAI Astra 推出. OpenAI 表示,即將推出的 Astra 是第一款達到其「重大資安」門檻的 LLM,能自主找出並利用未知漏洞。在 Hugging Face 遭駭後,OpenAI 延後 Astra 的部分開發以強化防護,並將限制最先進資安功能的存取。
Spark-X2.5 新模型. 開放模型 Spark-X2.5-4B 與 1.7B 出現在 Hugging Face,採用全新架構,宣稱效能可與 Qwen 3.5 9B 匹敵,並具備原生 1M context。目前還無法在主線 llama.cpp 上執行,但已有自訂 fork 支援。
Runway Solaris 介面模型. Runway 發表 Solaris,這款「介面世界模型」會即時生成 UI 畫面,而非執行程式碼,並會回應點擊與語音。目前仍屬研究階段,在文字渲染與螢幕閱讀器支援上也有限制。
本機 AI 與硬體
Qwen3.8 本機實測. 社群回報顯示,Qwen3.8 27B 與 Flash-Next 已能在多種硬體上執行:48GB Mac 約 12 tok/s、雙 Epyc R9700 搭配 MXFP4 kernels 的解碼速度達 280 tok/s、單張 RTX 3090 經自訂最佳化後也有 132 decode tok/s。量化評測則認為 UD Q3_K_XL 很適合 16GB 顯示卡,不過也有使用者認為 Qwen3.8 寫程式不錯,只是修改程式時過於積極。
- → Running 104GB Qwen3.8-Flash-Next on 48GB Mac at ~12 tok/s
- → How I got 280 tok/s on Qwen3.8 27B on 2xr9700's and 940k tokens kv cache
- → I pushed Qwen3.8-27B to 2.000 prefill per second and 132 decode per second on A RTX 3090.
- → Kaitchup posted Qwen3.8 27B Benchmarks for quants from Q4 to Q1
- → Everyone is t/s maxing.. 3.8.. but after a week of using it for work I'm tempted to switch back to 3.6
DGX Spark 漲價. Nvidia 的 DGX Spark 與 Asus Ascent GX10 都大幅漲價,其中 Asus 型號從 3,999 美元漲到 5,999 美元。買家開始質疑,把多台 DGX Spark 組成叢集,是否比記憶體頻寬更高的 AMD Epyc 系統划算;不過 DGX 支援 FP4 與張量並行。
CMP 170HX 故障. 有位使用者回報,5 張 CMP 170HX 中有 2 張在兩週內故障,第 3 張的 tensor core 也有缺陷;他認為以目前價格來說,不值得為 LLM 推論承擔這種風險。
INT8 與誤導性量化. 社群討論質疑,既然 RTX 3090 有原生 INT8 tensor core,為何 INT8 W8A8 模型沒有更普及?另一名使用者則指控 AtomicChat 把 IQ2_S 量化版誤標成 Q4_K_M。
Intel 重返記憶體. Intel 暗示可能重返記憶體事業,執行長提到延攬前 SK Hynix 高階主管 Seok-Hee Lee,以及新的記憶體架構,不過目前細節不多。
工具與框架
OpenClaw 2.0 發布. 開源個人 AI agent OpenClaw 2.0 簡化設定方式,會自動偵測既有的 ChatGPT/Claude 訂閱與本機模型,並把瀏覽器重新打造成主要操作介面。新版也加入共享雲端 session,方便協作。
Codex 本機工具. OpenAI 的 Codex 桌面版現在會在執行環境中內建完整的 LibreOffice,以及 Poppler、git 等二進位工具,讓文件處理技能不需要外部依賴就能執行。
AI 軟體工廠. Flue、tldraw 等頂尖 AI 開源專案開始拒絕外部 PR,改由 agent 團隊分類、重現、修復與審查 issue。Vercel 的 AI SDK 專案則部署 multi-agent「軟體工廠」,以消化超過 1,000 個 issue 與 800 個 PR 的積壓。
Terraform 管理 Agent. HashiCorp 將 HCP Terraform 定位為 AI 驅動基礎設施的治理控制平面,讓 agent 可以編寫並套用 Terraform 變更,同時仍能執行政策、身分與稽核控制。
datasette-mcp 更新. datasette-mcp 外掛釋出 0.2 版,將 SQL 查詢結果從陣列改為物件,幫助較弱的模型正確對應欄位。
研究與安全
BenchMIRT 基準稽核. Hugging Face 推出 BenchMIRT,可逐個 prompt 稽核 LLM benchmark,並揭露同一個 benchmark 中的 prompt 可能衡量不同能力,平均分數往往會掩蓋這點。
Gemini 影片理解上線. Google DeepMind 在 Gemini 3.7/3.6/3.5 Flash-Lite 推出 agentic 影片理解功能,透過原生影片工具動態搜尋與檢視影片片段,提高分析準確度並減少 token 用量。
Claude 文字浮水印. Anthropic 開放浮水印驗證 API 給監管機構、媒體與事實查核人員,讓獲准組織能透過統計模式偵測 Claude 生成文字;這個統計模式即使經過部分編輯仍可能留存,符合歐盟 AI Act 的要求。
選舉與偏見爭議. AlgorithmWatch 發現 Google 的選舉 AI Overviews 內容不一致、引用來源少,有時還會用帶黨派色彩的語言描述候選人。另一起事件中,Google 的 AI 搜尋會依使用者國籍提供緊急求助建議,Google 隨後修正。
產業與商業
AfterQuery 估值暴增. 據報導,AI 訓練資料新創 AfterQuery 以 32 億美元估值完成募資,估值五個月內成長 10 倍,成為 Y Combinator 史上最快變成獨角獸的公司。該公司聘請專業人士訓練模型,讓模型能像專業人士一樣完成任務。
AIR 募得 5,000 萬美元. AI 安全新創 AIR 結束 stealth 模式並宣布獲得 5,000 萬美元資金,將幫助企業盤點內部 agent,持續審查它們使用的 skills、MCP server 與 add-on,並阻擋未授權的軟體互動。
Google 爭取好萊塢授權. 據報導,Google 正尋求與大型片廠簽下授權協議,用受版權保護的內容訓練 AI 模型,並開出高額授權金;分析師警告,這類協議可能讓片廠的公眾形象受損。
DeepMind 聚焦 Frontier AI. Google DeepMind 新任執行長 Koray Kavukcuoglu 表示,能否在 frontier AI 取得領先地位是唯一要緊的事;他坦言目前模型離 frontier 還差一點,但誓言追上,對 Gemini 4 或 3.5 Pro 則沒有具體更新。
Agent 深入營運. OpenAI 的 Enterprise Signals 顯示,前沿企業每名活躍使用者的 output token 產出量是一般企業的 8.3 倍;Basis、Clay、Exa Labs 等新創也把 agent 帶入 onboarding、客戶管理與開發者整合流程。
Apple 與 OpenAI 法律戰. Apple 正聲請法院加速對 OpenAI 的證據開示,指控 OpenAI 沒有檢查一名前 Apple 員工的 MacBook;該裝置內有銷毀鑑識資料的相關討論。
Google Pics 設計工具. Google 推出 Google Pics,這是由 Nano Banana 驅動、專為 Workspace 打造的 AI 圖片生成與編輯工具,主打以 prompt 進行設計與精準物件編輯,要和 Canva、Adobe Express 競爭。
消費級 AI Agent. Fambot 推出 AI 家庭幕僚長,協助管理全家的生活後勤;John Deere 推出可利用農民自有資料的 JD AI 助理;Amazon 則為 Alexa 加入「Update Me When」購物提醒。
這就是今天的全部內容 - 約5分鐘閱讀。