Agent 與模型發布
Muse 硬體套件. Meta 開源了韌體與 SDK,讓開發者自行打造能連接自家 Muse agent 的 DIY 硬體,例如電子紙螢幕與 HDMI 電視棒,並開設 Discord 提供支援。
OpenAI Dot. OpenAI 新推出的 Dot agent 像是一套還能順便幫你訂晚餐的企業軟體,跑在虛擬機器裡,可存取 Blender、GIMP 等應用程式;官方把它定位成同事,而不是個人購物助理。
Unitree 人形模型. Unitree 發布 UnifoLM-WLA-1.0,這是用約 2,500 小時真實機器人資料訓練的 6B 模型,能在 G1 上執行 64 項全身與桌面任務,並結合光流與 MMDiT 實現連續控制。
FrogNano 程式開發. 微軟的 FrogNano-4B-2609 是衍生自 Qwen3.5-4B 的 agentic 模型,以 1,500 項合成 SWE 任務進行後訓練,獎勵訊號來自程式實際執行,讓小模型也能勝任 repository 層級的軟體工程。
Cloudflare Clef. Cloudflare 推出 Clef 與 Clef-flash 兩款決策模型,輸出的是各預設答案的機率,中位延遲最低 39 毫秒,讓 agent 不必等人類介入就能行動。
工具與框架
MegaCapybara 引擎. 一款專為 RTX 5090 與 Qwen3.8 27B 打造的推論引擎,宣稱解碼速度約為 NInfer 的兩倍:單一請求可達每秒 500 個 token 以上,同時跑 12 個 agent 時合計突破每秒 2,000 個 token,並採用動態 kernel 與快取管理。
llama.cpp 更新. llama.cpp 新增決策模型支援,並合併了一個 CUDA pull request,透過融合共享專家來加速 Qwen 35B A3B 之類的 MoE 架構。
mlsubgen 字幕工具. 一套新的地端工具能在自己的機器上完整產生 45 種語言的字幕:逐段偵測語言、用本地 LLM 調和兩套語音辨識器的結果,並優先沿用影片原有的內嵌字幕。
研究與模型進展
Spotlight 記憶架構. Percepta 的 Spotlight 用無上限的可寫入記憶取代 attention,由模型自己建立索引,把智能與知識拆開,能力因此能在不改動權重的情況下持續成長。
GPT-6 更新. OpenAI 發布 GPT-6 系列指南,並公布 DevDay 的多項更新,包括 GPT-6.1 Sol、Agents API 的 computer use、雲端 Codex 環境,以及 Decisions API。
AstaBrief 開源. Hugging Face 開源 AstaBrief,這是專為快速產出附引用來源的科學報告而訓練的小模型,設計上要求有憑有據,並能自行驗證輸出。
產業與商業
Apple 收緊磁碟存取權. 由於 AI agent 帶來風險,Apple 正在為 macOS 的「完整磁碟存取權」加入管控;此前 Meta Muse 被指未經允許讀取訊息。Meta 表示存取須由使用者主動開啟,Apple 則希望使用者做出非常明確的動作。
資料中心反彈. Amazon 承諾投入 10 億美元回饋資料中心所在社區,AWS 執行長 Matt Garman 呼籲終止資料中心禁建令,並聲稱這波反對是外國的不實訊息操作;微軟則在地方反對聲中擴大資料中心的仿生設計。
AI 改名超級智慧. 白宮促成多家科技大廠執行長簽署 AI 安全承諾,川普則簽署行政命令,把 AI 重新定名為「超級智慧」;但實際掏錢買 AI 產品的消費者只有 2%。
OpenAI 安全團隊震盪. OpenAI 開除三名研究員,另有一人離職;內部調查認定他們把機密資訊洩漏給一家外部 AI 安全組織。
Uber Eats 搜尋加速. Uber 重建搜尋流程,把端到端延遲降低 50%,過程中以 agentic coding 找出並驗證各項最佳化。
Airbnb 由內而外 AI. Airbnb 技術長 Ahmad Al-Dahle 採行由內而外的 AI 策略:先在內部用生成式 AI 加快產品開發,再回過頭改造顧客體驗。
地端 AI 與硬體
Strata 搭 Qwen3.8 Next. 使用者回報,Strata 搭配 Qwen3.8 Next,在記憶體為較慢 DDR4、搭配 7900XTX 的機器上跑出每秒 45 至 70 個 token;在限制功耗、搭配 96GB DDR5 的 RTX 5090 上則達每秒 150 至 200 個 token,明顯優於 llama.cpp。
iPhone 當第二顆 GPU. 把 iPhone 17 Pro Max 以 USB-C 接上 24GB 記憶體的 MacBook,並讓上層網路層跑在手機 GPU 上,可讓 Qwen 3.8 27B 的 prefill 加速 29% 至 44%。
Ascend 96GB 加速卡. 兩張各 96GB 的 Huawei Atlas 300I Duo 加速卡,在調校軟體堆疊後能以每秒約 30 個 token 執行 Qwen3.8 Flash-Next,儘管它們並非可直接取代 CUDA 的選項。
DGX Spark 與 5090 漲價. Nvidia 推出 64GB 版 DGX Spark,原本 128GB 版本的價格則漲到 6,950 美元;另外,據稱現在要在 Micro Center 買一張 RTX 5090,得先簽署不得轉出口的文件。
這就是今天的全部內容 - 約5分鐘閱讀。