Agentic AI News 今天

一天AI代理新聞,5分鐘讀完:發佈、工具、研究、募資和企業動態。

每日更新 精選自 30 個來源 星期六, 八月 15, 2026

模型發佈

Qwen 3.8 27B. 阿里巴巴的Qwen團隊以Apache 2.0授權發布了Qwen3.8-27B和更大的Qwen3.8-2.4T-A95B。27B稠密模型與Qwen3.6-27B共享相同架構,但透過訓練變更提升了編碼、辦公任務與代理規劃能力。它支援262k原生上下文,可擴展至1M token。

Zhipu的GLM-5.3. Zhipu AI發布了GLM-5.3,它使用與GLM-5.2相同的基礎模型,但延長了後期訓練。該公司聲稱這是最強大的開放權重編碼模型,在代理式編碼和網路安全漏洞發現方面有顯著提升。權重預計將於兩週內在Hugging Face上提供。

Meta的Muse Glimmer. Meta開源了Muse Glimmer,這是一個基於Apache 2.0的30B代理模型,旨在消費級GPU上運行本地工作流程。它從更大的Muse Spark中蒸餾推理和工具呼叫技能,並曾短暫成為30B類別的前沿模型。

中國開放模型浪潮. 在不到一個月內,中國實驗室陸續推出了Kimi K3、Qwen3.8、DeepSeek-V4-Pro-0813和GLM-5.3,突顯了開放權重前沿的快速進展。

本地部署與社群

Apple Silicon加速. 新的mlx-dspark版本為Apple Silicon上的Qwen3.8-27B帶來了推測性解碼,在M4 Pro上實現最高約3倍的生成加速,同時產生相同的輸出token。

量化與權重. Unsloth發布了Qwen3.8-27B的量化權重,Tim Dettmers則預告了一種新的量化方法,能在單台DGX Spark上以每秒7 token的速度運行GLM-5.3。

Qwen 3.8早期測試. 社群測試顯示Qwen3.8-27B在單次編碼示範和代理行為方面表現強勁,但部分用戶反映在極高推理強度下,常識知識明顯被修剪,且思維軌跡極長。建議的取樣參數可在模型卡上取得。

無審查本地版本. 社群中的'heretic'版本Qwen3.8-27B移除了拒絕和安全防護機制,旨在提供一個可與Opus 4.6等前沿模型媲美的本地無審查替代方案。

AI透明度與安全

Anthropic浮水印偵測. Anthropic將提供浮水印偵測API,讓第三方開發者能夠偵測可能由Claude產生的文字。該方法使用SynthID Text,對於簡短、事實密集或大幅改寫的文字可靠性較低。

Google將浮水印改為可選. Google允許用戶關閉Nano Banana、Omni和Lyria所生成AI影像、影片和音樂上的可見浮水印。不可見的SynthID和C2PA元資料仍會被嵌入以供驗證。

法院中的提示注入. 一位Connecticut法官記錄了似乎是第一份含有隱藏文字、意圖操縱審理案件的AI系統的US法院文件。這些隱藏指令沒有產生影響,但法官稱此手段危險。

生產環境中的代理

Claude Code維護職責. Anthropic表示,Claude Code一直在其自有應用程式上執行日常維護,建立了388個pull request,經人工審查後合併率為46%。常規工作包括崩潰模糊測試、重複抽象清理和依賴檢查。

OpenAI Computer History. OpenAI的Computer History取代了Chronicle截圖原型,記錄macOS上的點擊、按鍵和應用程式切換,以建立可搜尋的時間軸。它能偵測重複出現的工作流程,並為ChatGPT和Codex建議可重複使用的技能。

產業與商業

US-China價格戰. 隨著中國開放模型崛起,OpenAI和Anthropic正在降價;Google的Gemini 3.7 Flash初次亮相,針對編碼與代理提供50%的促銷降價。自7月中旬以來,美國頂尖實驗室的token價格已下跌近四分之一。

GPT-5.6 Sol Ultrafast. OpenAI推出了由Cerebras驅動的GPT-5.6 Sol Ultrafast模式預覽,每秒可輸出高達750個token。該API服務最初僅限於特定客戶,旨在用於事件或市場活動期間的即時分析。

Meta的AI給所有人. Meta在發布Glimmer的同時,發布了一封Zuckerberg的長信,主張AI應該向所有人開放,但播客報導指出,該公司將其最強大的Muse Spark保留在API之後。同一討論也提到了一筆2.5億美元收購失敗的事件。

Apple-Alibaba中國模型. 據報導,Apple在Alibaba的幫助下,為中國市場訓練了一個客製化AI模型,為將Apple Intelligence引入中國設備做準備。這項合作是罕見的美中AI協作。

Kog推論推進. 法國新創公司Kog正在利用軟體最佳化,從AMD MI300X和Nvidia H200等傳統GPU中提取更多速度,目標是為軟體工程工作負載提供更快的單請求解碼。

天然氣價格風險. Noreva的一項新預測警告,隨著Amazon、Google、Meta和Microsoft等超大規模業者鎖定天然氣發電以供應AI資料中心,美國部分地區的天然氣價格可能增至三倍。

研究亮點

150M ARC模型. 一個1.5億參數的循環潛在推理模型在ARC-AGI-1上得分29.5%,每個任務成本0.0007美元,位於已發表的成本-準確度前沿之外。它可以在極簡硬體上運行,但仍需擴展至數十億參數。

自主研究疑慮. 一項由Princeton和UK AISI進行的研究,使用未發表的NeurIPS論文,發現當前前沿模型能處理研究工程,但在研究關鍵部分卻失敗,與實驗室關於自主AI研究的說法相矛盾。

DarwinX框架演化. DarwinX透過對提示、工具、技能和控制流程進行自然選擇來演化代理框架,同時保持模型權重凍結。它在四個基準上平均增加約17分,並原封不動地遷移到SWE-bench Verified。

PlayWorld基準. PlayWorld使用追求171個長程目標的多模態代理玩家來評測影片世界模型,衡量幾何一致性、互動真實度、視野外演化和洞察演化。

這就是今天的全部內容 - 約5分鐘閱讀。

每天早上在瀏覽器中閱讀

此擴充功能在Chrome側邊欄中開啟摘要 — 一鍵點擊,無需帳戶。

新增至 Chrome — 免費