決策模型與結構化輸出
Jev 與決策模型. TypeSafe AI 發布 Jev,這是一款專做決策的模型,會回傳帶型別的機率;幾天內 AWS、Cloudflare 和 Perplexity 也各自發布開源決策模型。現有的結構化輸出/語法限制已經能提供類似的受限生成。
- → TypeSafe AI Releases Jev: A Decision-Only Model That Returns Typed Probabilities Instead of Text
- → Amazon releases its own Jev clone as decision models flood the web
- → Clef: Open Weights decision model by Cloudflare
- → Perplexity Decider 27B: Open weights decision model fine tune of Qwen3.8 27B
- → Guys... OpenAI API on VLLM and Llamacpp already supported grammar enforcer... (AKA JEV)
本機決策 LoRA. Jeff-Qwen3.5-0.8B 搭配九個 LoRA 適配器,可處理提示注入、工具選擇等重複出現的 agent 決策,速度提升 38 倍、準確率增加 8.7,額外記憶體用量不到 2GB。
Agent 與產品發布
OpenAI Dots 對上 Meta Muse. OpenAI 發表 Dots,一款可愛風格的 GPT-6 Astra 驅動 agent,能打造虛擬世界,但僅限每月 1 美元的方案使用,面對 Meta 免費的 Muse。
Shopify Canvas. Shopify 推出 Canvas,讓商家透過與 AI Sidekick 對話來建立商店,並即時渲染實際程式碼。
ChatGPT 虛擬試穿. OpenAI 在 ChatGPT 購物功能中加入虛擬試穿與收藏,透過 Images 2.5 模型在使用者照片上呈現衣物。
Tavus Griffin 虛擬化身. Tavus 推出 Griffin,一款即時視訊虛擬化身模型;48% 的受試者在一次一分鐘通話中誤以為它是真人。
Photon 為 App 辦葬禮. Photon 為行動 App 舉辦葬禮,並募得 450 萬美元,協助開發者在 iMessage/WhatsApp 上打造以訊息為基礎的 agent。
開源模型與本機 AI
Gemini 4 Argon. Google DeepMind 推出 Gemini 4 Argon,具備 SOTA 基準測試成績,輸出 token 最多可達 100 萬,初期僅限網路安全預覽。
K2 Horizon 開源艦隊. IFM 發布 K2 Horizon,包含六款從 0.9B 到 375B 的開源模型,並附上訓練資料、程式碼與日誌;團隊將針對開放開發舉行 AMA。
Qwen Flash Next MTP. llama.cpp 合併了 Qwen Flash Next 的多 token 預測支援,提升推論速度。
Slipstream 登陸 Mac. Slipstream 是一款 Metal 推論引擎,可在 64GB 的 Mac 上以 41-52 tok/s 執行 95.5 GiB 的 Qwen3.8-Flash-Next,速度比 llama.cpp 快 1.76 倍,且長上下文表現穩定。
Olmo-core 3. Allen AI 發布 Olmo-core 3,這是專為兆參數 MoE 模型打造的開源且可擴展訓練基礎設施。
研究與基準測試
Ataraxos 攻克 Stratego. CMU、MIT、NYU、史丹佛研究人員打造 Ataraxos,以 15 勝 1 敗 4 和擊敗最強 Stratego 玩家,讓人類再失一座堡壘;訓練成本不到 8,000 美元。
Agentic RAG 勝出. 在 FRAMES 上比較 18 條 RAG 管線與一個 agent 迴圈的基準測試:最佳管線為 78.9%,agent 迴圈為 92.7%,顯示檢索 agent 的表現優於固定管線。
AutoSynthData. ServiceNow CoreAI 打造 AutoSynthData,從模型失敗與教師成功案例中生成訓練資料,藉此改善企業 agent。
AI 寫作特徵. Graphite 找出 13,000 個可辨識為 AI 的詞組;Claude 模型愈來愈接近人類的詞彙分布,GPT 則愈來愈遠。
產業、政策與安全
Google 反壟斷案遭駁回. 法官駁回 Chegg 與 Penske 的訴訟,兩者指控 Google AI Overviews 非法減少流量;反壟斷主張不成立。
Grok 影響委內瑞拉. 《時代》報導,川普在入侵委內瑞拉前與 Grok 交談數小時;Grok 預測會出現慶祝場面,強化了川普的看法。
OpenAI 安全研究員離職. OpenAI 與三名安全研究員分道揚鑣,原因是他們涉嫌與第三方安全組織分享機密資訊。
Anthropic 進軍政府市場. Anthropic 推出 Claude for Government,在 FedRAMP High 環境中供民用機構使用;五角大廈的禁令在訴訟期間仍未解除。
太空資料中心. Google 發射搭載 TPU 的原型軌道運算衛星;Satlyt 募得 800 萬美元,為衛星 AI 打造軟體,但要規模化仍需 Starship。
Agent 截圖外洩. Glow Security 發現 AI agent 將 13,000 多張內部截圖上傳到公開 GitHub repo,導致客戶資料與憑證外洩。
推理竊取行動. OpenAI 表示已阻止針對受保護推理的對抗性蒸餾行動;類似手法在 Azure 上仍然奏效。
這就是今天的全部內容 - 約5分鐘閱讀。