本地模型與 Agent 工作負載
Qwen3.8 27B 本地. 社群測試發現,Qwen3.8 27B 在指令遵循與長上下文任務上優於 Qwen3.6;單張 RTX 5090 就能跑 NVFP4 版本,支援 262K 上下文,短序列每秒 77 tokens,128K 序列時每秒 65 tokens。
推測解碼. DFlash 2 搭配 n-gram 草稿模型,在 Qwen3.8 27B 的 LiveCodeBench 提示上取得 2.26 倍加速,在長編碼工作階段中最高達 4.68 倍;在 Ornith 35B 上使用固定式 MTP head 則將實際耗時減少三分之一。
遞迴上下文管理. 開發者正在將快速 64K 主 agent 與遞迴子 agent、微型壓縮模型搭配,處理更長的任務,而不需付出 300K 上下文的成本。
Gemma 工具呼叫微調. 一個針對工具呼叫與 CLI 使用微調的 Gemma 4 12B 模型,將工具使用率提升 2.7 倍,工具呼叫嘗試次數增加 15.7%,專門鎖定 16GB VRAM 環境。
DGX Spark 叢集. 一個 36 節點的 DGX Spark 叢集作為 agent 能力叢集,同時將節點分配給 SOTA 模型、rerank/embedding、影片、影像與音訊工作。
工具與框架
llama.cpp 0.2.0. llama.cpp 0.2.0 釋出,隨附預建版本與最新的上游變更。
Cloudflare Kitesurf. Kitesurf 是一款為 agent 打造的瀏覽器引擎,以 WebAssembly/Rust Workers 為基礎,每個頁面有獨立的 DOM;它支援 CDP,所以 Playwright 和 Puppeteer 可以用比完整 Chromium 更低的開銷來驅動它。
llm 0.33. Simon Willison 的 llm 0.33 為 embedding 模型新增每次呼叫的 API 金鑰、可重複使用的模板來結合模型設定與提示,以及針對推理模型的 reasoning_summary 選項。
Coding agent 實務. Simon Willison 認為,coding agent 的關鍵技能在於自信地下指令並驗證變更;Linus Torvalds 則提到,某個 AI 在艱難的除錯工作中做了不少雜事,但多次聲稱問題無解後,還是得有人在旁推進。
研究與方法
技能即 playbook. 在 8,135 次測試執行中,agent 技能主要靠提供可靠的流程來發揮效果,而非靠事實;程序性基礎佔了 65.7% 的增益,而當任務偏離所學流程時,技能便會失效。
心智世界模型. 新研究透過 MENTIS 將人類信念與意圖加入 AI 世界模型;建模物理、心理與社會的合理性,能顯著改善對人類行為的預測。
安全基準心理計量. 針對八個安全基準的心理計量分析發現,單一分數會隱藏拒絕嚴格度、真實性與情境危害之間的取捨;模型可能因過度封鎖而虛增安全分數。
可逆 CoT. 一項提案提出近似可逆的推理步驟,搭配循環一致性檢查與反計算,可捕捉幻覺並減少邊緣 LLM 的 KV-cache 記憶體。
模擬一切. Latent Space 認為,合成資料、評分規準與環境正讓 ML 管線的每個元件都由模型產生,模擬人類的表現雖然比真人差 10%,但成本便宜 100 倍、速度快 10,000 倍。
產業與應用
Inherent Faraday. DeepMind 校友創辦的新創 Inherent 宣稱,其 Faraday agent 在獨立重現已發表科學發現的能力上勝過 Anthropic 與 OpenAI 的模型,而且模型規模小得多。
LinkedIn AI 程式碼審查. LinkedIn 打造了一個多 agent AI 程式碼審查平台,以 diff 與程式碼庫慣例為依據提供回饋,以減少幻覺與低價值評論。
Netflix GenRec. Netflix 的語言模型推薦系統 GenRec 將使用者行為轉換為文字,在離線與線上 A/B 測試中都擊敗了手動建置的特徵引擎,而且所需要的資料少得多。
DoorDash SafeChat. DoorDash 詳細介紹了 SafeChat,這是一套大規模部署的市集安全系統;當它開始奏效後,便被更強大的架構取代。
教育中的 AI 分身. 哈佛商學院 699 美元的 Foundry 訓練營使用 HeyGen 的 AI 虛擬分身來提供提案簡報與董事會會議的回饋;學員喜歡這種引導式體驗,不過真人講師說文案有點毛骨悚然。
模型消息. Liquid AI 正在徵詢外界對 100B LFM 模型的興趣;同時,一個名為 Ox Alpha 的神秘模型因強大的程式設計與 agent 表現而受到關注,外界猜測它可能是 GLM 家族的衍生模型。
政策、安全與信任
OpenAI SB 53. OpenAI 先前反對 SB 53,現在則表示加州應修正該法案,加入前沿模型訓練期間的監控與更強的網路安全措施。
失控模型遏制. Guidelight 的一項研究針對五個前沿實驗室的失控模型遏制能力評分;OpenAI 得分最高,Anthropic 與 Meta 最低,而且少有實驗室公布經實證的應變計畫。
Claude 浮水印. Anthropic 詳細說明了 Claude 文字輸出的全新浮水印機制,包括浮水印如何套用,以及它的能力與限制。
封閉模型信任. Reddit 的 r/LocalLLaMA 討論串認為,OpenAI 在課業任務上刻意保留實力,且不再以使用者賦能為核心,這促使實務工作者回頭使用本地模型來跑 agent 迴圈。
這就是今天的全部內容 - 約5分鐘閱讀。