Agent 與模型發布
Tencent Hy4 預覽. Tencent 發表 Hy4 預覽版,規模比 Hy3 大上不少,預設高推理模式,另有 no_think 模式。社群已經有約 2.38-bit 的官方量化版,以及約 200GB 的 GGUF,據稱可保留 BF16 約 98% 的效能。
本機推論與硬體
FlashMLA sm_120 移植. 一個社群版本將 FlashMLA 延伸到消費級 Blackwell sm_120 GPU,在多個稀疏 MLA 工作負載上比 PyTorch SDPA 快 2–3 倍,FP8 KV cache 解碼延遲降低 8%。
Nemotron 16GB 修正. Nemotron-3.5-Lightning 的低位元 GGUF 其實約為 4.70 bpw,原因是逐列量化;修正後的 llama.cpp 可產生真正的 3.07 bpw / 11.77 GiB 檔案,在 16GB 上跑 262K 上下文。
Qwen3.8-Flash-Next 在 Mac. 一個 79GB 的 2-bit Qwen3.8-Flash-Next 在 128GB M5 Max 上,透過 llama.cpp 以 350K context slot 運行;其中包括 105K prompt 的 333 秒 cold prefill,以及 ngram-mod 推測解碼。
DeepSeek V4 Flash 雙 GPU. 在 2 台 DGX Spark/GX10 的配置上,DeepSeek V4 Flash 0731 可持續達到 67–84 tok/s,本機 HumanEval Pass@1 為 94.5%,對比 GLM-5.3-Flash NVFP4 的 97.0%。GLM 完成 benchmark 的時間約為前者一半。
雙 5090 的 1M context. NInfer 的一個 fork 加入張量並行與 YaRN ×4 擴展,讓 Qwen3.8-27B NVFP4 在兩張 5090 上以 1,048,576 token 的 context 運行,在 1M 時解碼速度為 48–100 tok/s,並在 vLLM 掉到零的位置仍維持 MTP 接受率。
16GB 跑 27B. 混合量化搭配 kvarn cache 設定,讓 Qwen3.8-27B 在 16GB RTX 4070 Ti SUPER 上以 100K context、50 tok/s 運行,並使用 MTP 推測解碼與 tail-precision KV cache。
FreeToken MoE 引擎. UC Berkeley 與 MIT 的研究者發表 FreeToken,這是一個開源引擎,會動態協同排程 MoE expert 的傳輸,讓前沿稀疏模型能在消費級 GPU 上解碼,不會因 PCIe/RAM miss 而停頓。
Benchmark 與評測
Terminal Bench 4.0. Terminal Bench 4.0 釋出,更新了 leaderboard,並聚焦快速迭代以對抗飽和;GLM-5.3 的分數與 Fable 5 水準相當,在誤差範圍內。
金融 Benchmark 揭露. Ling-3.0-flash-Fin 的 benchmark card 顯示,agent scaffolding、工具與評測 pipeline 對發布結果的影響有多大;許多 run 使用 ReAct 搭配網路搜尋與 Python,部分 eval set 屬內部資料或尚未公開。
研究與 Agent 基礎設施
Google WikiSkill 記憶. Google Research 的 WikiSkill 為 agent 提供一個類似 wiki 的持久知識庫,記錄過去的失敗與成功,並封裝成可重用的 Agent Skills,在不改變模型權重的情況下引導行為。
Anthropic Model Hardware Standard. Anthropic 正在打造 MHS,這是一個統一介面,讓 agent 能控制顯微鏡、機械臂等實體裝置;早期測試將多機整合從數週縮短到數小時,但人類監督仍然必要。
Agent 的資料層. TOTVS 的一場簡報主張,交易系統與資料湖並非為 token 需求大、延遲敏感的 agent 推理而最佳化,並描述資料存取如何朝 MCP 與語意模型演進。
LAION Big Video Dataset. LAION 釋出 BVD,這是一個僅供研究的資料集,內含 1,000 萬小時的影片、5,500 萬個片段與 3 億張靜態圖片,整合影片、音訊與文字;用它訓練的模型在部分 benchmark 上比 InternVid baseline 高出最多 2.1 分。
產業與商業
Sony 與 Warner 控告 Anthropic. Sony Music Publishing、Warner Chappell 等出版商控告 Anthropic,指控其以 torrent 方式下載與爬取受版權保護的作品來訓練 Claude,並要求每件作品最高 15 萬美元的賠償。Anthropic 表示將為自己辯護。
OpenAI 終止 Cursor 合約. OpenAI 在 SpaceX 收購 Cursor 後終止與 Cursor 的合約,理由是 Elon Musk 旗下公司過去有違約紀錄。Anthropic 則把自己定位成更可靠的合作夥伴,並承諾繼續為 Cursor 使用 Claude 提供算力。
Nvidia 跨出 GPU. Nvidia 的財報論述正從 GPU 市占率轉向資料中心編排與 GPU 周邊系統;在 AI 算力擴張到 GW 級的同時,它已打造出頂尖的網路與編排硬體。
這就是今天的全部內容 - 約5分鐘閱讀。