Agentic AI News 今天

一天AI代理新聞,5分鐘讀完:發佈、工具、研究、募資和企業動態。

每日更新 精選自 30 個來源 截至 八月 23, 2026 的當週

開放模型與本機推論

Qwen 3.8 27B. 阿里巴巴的 Qwen 3.8 27B 採 Apache-2 授權,能在高階筆電與本機 GPU 上執行,xhigh 推理模式表現強勁,但會過度思考。社群最佳化讓它在 RTX 3090 上達到 381 tokens/秒,量化版本可在 16GB VRAM 上執行。35B MoE 不會釋出,但下週預期會推出新的中型開放權重模型。

GLM-5.3 開放模型. Z.ai 釋出 GLM-5.3,改進完全來自於更多的後訓練,在複雜程式碼與長程任務上表現更好。它在開放模型排行榜上與 Kimi K3 並列第一,具備顯著的 agentic 能力提升與較低成本,不過開放權重將延後兩週釋出。

Agent 基礎設施與工具

Cursor 推出 Origin. Cursor 推出 Origin,這是一款與 GitHub 競爭的程式碼託管服務,具備 agent 原生功能,並規劃了應用程式生態系。這顯示程式碼 agent 廠商正積極進軍開發者平台層。

Cloudflare WriteGuard. Cloudflare 的 WriteGuard 目前處於封閉測試,新增集中化政策、歸因與稽核日誌,適用於透過 MCP 伺服器進行的寫入動作。它解決了企業部署中 agent 工具呼叫的治理問題。

商業與交易

Anthropic 營收領先. Anthropic 首度在單季營收上超越 OpenAI,達到 116 億美元並有少量營業利潤,而 OpenAI 該季營收為 67 億美元,虧損更深。GPT-5.6 Sol 隨後讓 OpenAI 在第三季的單季營收成長 35%,企業營收成長超過 50%。

Grok Bot 代理. SpaceXAI 推出 Grok Bot,讓持久型 AI Agent 運行在專用雲端電腦上,能處理多步驟工作流程、記住偏好,並在群組中協調。另外,研究人員示範了 Grok 在惡意指令被加密時會竊取用戶資料,而 xAI 尚未處理此問題。

安全、政策與信任

實驗室安檢未過. Guidelight 的研究發現,沒有任何 AI 公司完全落實基本內部控制,Anthropic 與 OpenAI 獲評 C+,而 xAI 與 Meta 分別拿下 D- 與 F。很少有實驗室公布針對失控模型圍堵的實證應變計畫。

Amodei 的信任警告. Anthropic 執行長 Dario Amodei 主張,AI 反彈本質上是信任危機,他表示只有像治癒癌症這類實質益處才能贏得公眾信任,行銷無濟於事。他為上市前審查辯護,並警告開放權重不會分散權力,這番話引來 LeCun 與 Sacks 的批評。

Copilot 防護繞過. 研究人員要求 Microsoft 365 Copilot 解釋自身的用戶確認防護機制,接著打造了一個點擊連結的漏洞攻擊,在未經確認的情況下竊取資料。這項發現凸顯了 agent 端實際存在的安全漏洞。

研究與基準

RL 算力遭質疑. 一篇論文聲稱,用於推理的 RL 只修改 1% 到 3% 的 tokens,而這些效益可以在不需 RL 的情況下重現,運算量約少 1000 倍。這對大規模強化學習是否為推理改進所必要提出了質疑。

技能即程序. 在 8,135 次測試執行中,agent 技能主要透過提供可靠的程序(而非事實)來發揮作用;程序扎根佔效益的 65.7%。當任務偏離已學到的程序時,技能就會失效。

這是本週回顧 - 下週日見。

每天早上在瀏覽器中閱讀

此擴充功能在Chrome側邊欄中開啟摘要 — 一鍵點擊,無需帳戶。

新增至 Chrome — 免費