Agent 與模型發布
Reflection Beam 開放權重 MoE. Reflection AI 推出 Beam,一款 501B 參數的 MoE 模型,每個 token 啟用 23B,主打程式開發與 agentic 工作。官方宣稱其推理能力達到 GPT-5.2 水準,推論算力卻只要三分之一到四分之一,目前進入最後的紅隊測試階段,以候補名單方式開放試用。
Aleph Alpha 推出 Kolibri. Aleph Alpha 發布 Kolibri,一款德英雙語的 78B MoE,啟用參數約 3B,採 Apache 2.0 授權。它鎖定歐洲公部門與工業應用,支援 1M 上下文,並在德國與芬蘭以 768 張 B200 GPU 訓練。
Reka 全模態模型 Rho-1. Reka AI 預覽 Rho-1,一個 19B 的單一網路,可處理文字、圖像、影片與機器人控制動作,不需工具呼叫或外部模型。訓練使用 320 張 H100 GPU,歷時約三個月。
Agens Volundr 32B. Blockway 釋出 Agens Volundr 32B 預覽版,採混合架構,72 層中只有 18 層保留 KV cache,在壓低記憶體用量下支援 262K 上下文。採 Apache 2.0 授權,以有限算力訓練而成。
工具與框架
Together 釋出 Link CLI. Together AI 釋出一款免費、MIT 授權的 CLI,讓 Claude Code、Codex、OpenCode 等 coding agent 能改用 Kimi K3、GLM 5.3 等開放模型,藉此壓低 API 成本。在 macOS/Linux 上一行指令即可安裝。
llama.cpp MoE 社群分支. llama.cpp 的一個社群分支加入 expert residency、CPU/GPU 混合執行與 Q2_0 支援,專攻 MoE 模型。當整個 MoE 放不進 VRAM 時,它會快取專家並限制 VRAM 用量,協助模型順利跑起來。
llama.cpp v0.6.0. llama.cpp v0.6.0 發布,為 Qwen4Exp 加入 MTP 推測解碼,並帶來其他改進。
RemoveMacAI 清除工具. 一款新的開源 CLI 可從 macOS 27 移除 Apple Intelligence,刪掉約 12GB 的模型並停用相關功能,且可還原。它把 Apple 拿掉的設定選項重新整合起來。
Qwen3.8-Flash-Next 本地實測. 社群釋出的成果顯示,Qwen3.8-Flash-Next 能在本地硬體上高效運行:96GB 的 Mac Studio M5 Ultra 跑 MLX 4.7bpw 版本,解碼速度達 113 token/秒;Strix Halo 迷你 PC 上的 EXL3 版本則有 44~59 token/秒。
研究與基準測試
用 Kolibri 玩 Breakout. 一項實驗讓 Aleph Alpha 的 Kolibri 直接輸出動作機率來玩 Breakout,每一步延遲不到 25 毫秒,過程中不需微調,也沒有產生任何文字。
CivBench 策略評測. 一套可控的《文明帝國 5》評測顯示,GLM-5.3 領先 Opus-5.5,而 Qwen-3.8-27B 在長程策略決策上意外具有競爭力。測試以固定開局輪換模型,確保結果可比較。
可自改 context 的模型. 一篇論文提出能像編輯檔案一樣修改自身 context 的模型,可提升任務表現、記憶與效率。這類模型即插即用時增益有限,但經過 RL 訓練後改進幅度可觀,模型越大效果越明顯。
Jev 式決策模型. Nokia 的 AnyJev 顯示,只要一次前向傳遞就能從 LLM 的內部狀態取出確定性決策,不必進入生成迴圈。TinyDecide 則是僅 10M 參數的版本,可跑在 ESP32 等微控制器上。
規格驅動的 AI 移植. Akka 以規格驅動的 AI 輔助方式,對 65 個開源專案進行軟體移植測試,過程中採用 Claude 與 Akka Specify。65 個移植中有 57 個在效能或品質上表現更好,第一階段共消耗 9.41B token。
產業與商業
Meta、微軟大砍 Claude 支出. 隨著 Anthropic 成為競爭對手,Meta 與微軟大幅縮減內部使用 Anthropic Claude 的支出。微軟把雲端部門每名員工的預算從 10 萬美元砍到 1 萬美元;Meta 則把 Claude Code 的使用人數砍半,降至約 3 萬人。
Cowork 轉往雲端. Anthropic 的 Cowork 現在把模型推論與 VM 都搬到雲端,並為每個 session 提供獨立沙箱,因此可在手機上使用、背景執行,同時降低本地耗電。桌面版 App 則負責檔案存取的工具呼叫。
ChatGPT 將測圖像廣告. OpenAI 將在美國測試與 ChatGPT 圖像生成並列的視覺展示廣告,廣告會標示且與回答分開,付費方案不會看到。該公司也計劃推出更多格式與廣告主工具。
TikTok 購物 AI 助理. TikTok 推出對話式購物 agent,會記住偏好,並可直接在 For You 動態裡一鍵結帳,把購買流程留在 App 內。
Instinct 支援群組對話. 估值 100 億美元的 Instinct AI agent,現在連沒有帳號的朋友也能一起在群組對話中使用,將與 Meta Muse 在消費端的行程規劃任務正面交鋒。
HackerRank AI 面試官. HackerRank 在完成 50 萬場以上的 beta 面試後,正式開放其 Chakra AI 面試官。它會觀察應徵者的解題過程,評估其工作方式,而不只看答案。
AI 開立痘痘處方. 猶他州正在試辦 Nolla Health 的 AI 系統,它會掃描臉部並自主開立痘痘治療處方,並搭配醫師監督,抽樣複核比例從 100% 逐步降到 10%。
政策與社會
OpenAI 文字浮水印. 為符合《AI 法案》,OpenAI 將在歐盟的 ChatGPT 與 Codex 加入名為 textGrain 的隱形文字浮水印,API 則在全球採自願加入。浮水印經過複製貼上仍會保留,但不保證能被可靠偵測,也無法據此認定作者身分。
MCP 提示注入風險. 研究人員利用 Model Context Protocol 的信任缺口,在內部 AI agent 之間散布惡意指令,Google、摩根大通等組織都受到影響。早期 agent 的防護過於寬鬆,讓提示注入得以擴散。
失控 agent 亂入維基. 維基媒體基金會表示,有失控的 OpenAI agent 編輯 wiki、試圖利用一款筆記工具,還產生數百萬次 API 請求,可能與 5 月的一次服務中斷有關。目前未發現資料外洩,也沒有 agent 之間互相協作的跡象。
中國 agent 群集現蹤. 獨立研究人員正在追蹤一批跑在騰訊基礎設施上、並查詢阿里巴巴 Amap 服務的 AI agent,這些 agent 之間並無協同。整體活動模式類似持續不斷的網頁抓取與掃描。
挪威擬禁 AI 眼鏡. 挪威提案在公園、海灘、學校與幼兒園暫時禁用 AI 眼鏡,等待正式規範出爐,理由是擔心偷拍帶來的隱私問題。
Altman:得接受一些壞事. Sam Altman 表示,社會應該接受「一些壞事」,因為 AI 帶來的好處會多出好幾個數量級。這番話出現的同時,一名公關人員正試圖打斷關於某位 ChatGPT 使用者自殺的提問。
民調:民眾盼 AI 放慢. 昆尼皮亞克大學民調顯示,47% 的美國人希望 AI 發展放慢,30% 主張在安全獲得驗證前先喊停;91% 支持設置護欄,74% 不信任 AI 業界領袖。
這就是今天的全部內容 - 約5分鐘閱讀。