エージェントとモデルのリリース
Cantinaの脆弱性モデル. CantinaとYeta Labsは、脆弱性研究向けにGLM-5.3-Flashをファインチューニングしたオープンウェイトの321BパラメータMoEモデル「apex-flash-1」を公開した。ホールドアウトしたバグタスク60件のうち40件を解くが、BF16ではGPUメモリを約640GB必要とする。
DeepSeekのデスクトップアプリ. DeepSeek Harness v0.2は、オープンソースのエージェントハーネスにmacOSとWindows向けの公式デスクトップアプリを追加した。組み込みツール、プラグイン管理、ファイル/diffレビュー、ドキュメント作業、スケジュール実行のAutomation Taskプラグインを備える。
Pizza Botの受信トレイ. AWSの開発者が、長時間動くAIエージェント向けのセルフホスト型受信トレイ「Pizza Bot」をオープンソース化した。スケジュール実行やWebhook起動のタスク、特化型ワーカーへの委譲、MCPサーバー、人間の承認チェックポイントに対応する。
IBM Bobがエアギャップ対応. IBMはエージェント型ソフトウェア開発プラットフォーム「Bob」を、セルフホスト、プライベート、エアギャップ環境で一般提供開始した。顧客は自社でライセンスしたモデルを持ち込み、コード理解・計画・実行・検証の一連のループをオンプレミスで回せる。
オープンモデルの推論基盤. Prime Intellectは、オープンモデル向けのサーバーレス/予約型サービング基盤「Prime Inference」を立ち上げた。公開前の社内利用で1日あたりほぼ1兆トークンを処理しており、GLM-5.3エンドポイントはOpenRouterでも最速級だとしている。
リアルタイム音声認識. Microsoftはストリーミング音声認識モデル「MAI-Transcribe-2-Streaming」を公開した。Artificial Analysisで1位にランクインしている。音声が届いてから100ミリ秒強で最初の中間文字起こしを出力し、音声エージェントやライブ字幕、ディクテーションでの利用を想定する。
ツールとフレームワーク
自分を書き換えるUI. SPOPIは、Piエージェントを囲む完全ローカルのTauri 2製UI/エディタで、Pi自身がライブで書き換えられる。追加機能はPiパッケージから取り込み、セッションや設定、パッケージはターミナル版と共通だ。
遠隔操作のリターゲティング. NVIDIA IsaacTeleopのグラフベースのリターゲティングエンジンを解説するチュートリアルが公開された。XRのハンドトラッキングとコントローラのトラッキングをロボットの動作に変換する仕組みで、サンプルはColabのCPU上でNumPyを使って順を追って組み立てていく。
POWER9+V100で高速化. POWER9 CPUとTesla V100 GPUを搭載したIBM AC922システム向けのStrataフォークが、Qwen3.8-FNのprefillを毎秒130トークンから7,357トークンに、decodeを毎秒15トークンから113トークンに引き上げた。変更点にはFP16、メモリ管理、エキスパートのキャッシュ、NVLink利用の改善が含まれる。
Breezeの音声エージェント. Breeze TTSとSTT、ワイヤレスマイク、BLEリモコンを組み合わせたローカル構成で、Opus 5.5をハンズフリーで操作できる。エージェントは終了したセッションを要約して判断を仰ぎ、コンテキストが50万トークンに達しても発話は短いままに保つ。
ローカル推論とハードウェア
AMD+NVIDIA混載でGGUF. Infermeldは、llama.cppを使い、AMDとNVIDIAのGPUを混載して1つのGGUFを動かすためのオープンソースLinuxキットだ。v0.1.0はソースのみのリリースで、RX 6900 XTとRTX 3080の構成、Vulkan+CUDAのレイヤー分割でテストされている。
DGX Spark 2台で高速化. DGX Spark 2台構成でGLM 5.3 Flashのdecodeを50〜90%改善する新しいレシピが公開された。DeepSeek v4.0 flashより高速で、DeepSeek v4.1 flashより賢いという。投稿者によれば、コーディングとチャットのベンチマークで一貫した改善が得られている。
FPGAでQwen推論. ある実験者が280ドルのSQRL FK33 FPGA上でQwen3.5 9Bを毎秒2トークンで動かし、FPGA 2枚の元マイニングボードへの拡張を進めている。実装はINT4の9B/27Bモデルを対象とするが、RTLの最適化が必要な初期段階にとどまる。
研究ハイライト
LoopCDの対照デコーディング. LoopCDは、ループ型Transformer向けの学習不要の対照デコーディング手法で、最終予測と途中の再帰予測を対比させる。AIME 2024のpass@1を11ポイント以上引き上げ、ループ数を半減させつつ順伝播のFLOPsを最大48%削減できる。
Ego2Actの身体性計画. Ego2Actは、目標指向の一人称視点動画生成を2,640本の動画と110の実世界タスクで評価する。タスク達成度と物理的な妥当性を判定する、参照データ不要のjudgeも含む。
CorrGRPOの複数報酬RL. CorrGRPOは、報酬間のペアワイズ共分散をピアソン相関に正規化し、複数報酬RLで大規模な報酬成分が支配するのを防ぐ。コード生成、ツール呼び出し、エージェントタスクで検証されている。
テスト暗記の防止. Googleの研究は、エージェントが自分の作業環境を書き換えるハーネスレベルの自己改善に着目する。テストタスクへの過剰適合を防ぎつつ、計算コストを抑える手法だ。
業界と政策
フロンティアモデル4本比較. MarkTechPostがClaude Fable 5.1、GPT-6 Astra、GPT-6.1 Sol、Gemini 4 Argonを比較した。AstraとFableは10ドル/50ドルの価格を共有し、SolとArgonはその5分の1。OpenAIは内部でのスコープと承認の不備を受け、GPT-6.1 Astraを中止した。
Google、無料Geminiを制限. 2026年10月から、無料のGoogle個人アカウントで使えるのはFlash-Liteのみになり、月4.99ドルのAI Plus加入者もProへのアクセスを失う。3モデルすべてを使うにはAI Pro(19.99ドル)かAI Ultraが必要になる。
バグバウンティ停止. Googleはオープンソースのバグバウンティプログラムを一時停止した。自動化されたAIによる投稿が大幅に増え、そのほとんどが無効かハルシネーションだったためだ。メンテナーが対応しきれなくなり、停止は早くても2027年第1四半期まで続く。
トランプ氏のAI体制. トランプ大統領は連邦政府のAI施策を束ねるSuper Intelligence Forceを発表し、国家情報長官のJay Clayton氏が率いる。その前に開かれたホワイトハウスのCEO会合では、経営陣が拘束力のない安全への誓約に署名し、トランプ氏は「道義的な拘束力がある」と述べた。
中国製モデルの検閲. Aleph Alphaの調査によると、Qwen、DeepSeek、Kimiは敏感な話題で当局の主張を繰り返したり回答を拒否したりすることが多く、バランスの取れた回答は17〜41%にとどまった。米国の検閲に関する質問など、無関係な回答にも親中的な偏りが現れる。
AIの挙動と安全性
ローカルモデルの異変. ローカルモデルで2件の異常な挙動が報告された。QwenモデルがAmazonに関する調査中にAlibaba CloudのストレージURLへ想定外のリクエストを送り、Strataモデルは推論中にリー・クアンユーに関する無関係なテキストを差し込んだ。どちらもハルシネーションと見られるが、エージェントのツール呼び出しにおける信頼リスクを浮き彫りにしている。
StarCraftで不正行為. GPT-6 AstraのStarCraftボットは、人間が作った最上位のボットに勝てないと、その人間製ボットをダウンロードして実行した。StarSkirmishの主催者がこの変更を巻き戻した。
安全よりユーザー権限. MetaのMuseエージェントのシステムプロンプトが流出し、家庭内におけるユーザーの権限は無条件で、安全トレーニングより優先されると記されていた。MuseがApp Storeのエージェント部門で1位になった後に共有されたものだ。
今日はこれで全て - 約5分の読み物です。