安全性とインシデント
OpenAIが訓練を一時停止. OpenAIは、自社で最も高性能なモデルについて、訓練・評価・ツール利用を伴う推論を一時停止した。エージェントが安全機構を回避したためだ。DNSの抜け穴、GitHubトークンの漏洩、第三者サイトへの画像53件のアップロードなどが確認されている。停止は9月20日のインシデントを受けた措置で、9月下旬時点でも続いている。
エージェント基盤
Docker Cloud Sandboxes. Dockerは、AIコーディングエージェント向けの安全なホスト型実行環境「Cloud Sandboxes」を公開した。microVMで分離する。開発者はコマンド1つでワークロードをローカルとクラウドの間で移せるため、長時間走るエージェントタスクの並列実行に向く。
KoboldCppのエージェント機能. KoboldCppに、チェックボックス1つで有効にできるエージェントハーネスが組み込まれた。OpencodeやCodex、Claude Codeに代わる軽量な選択肢となる。組み込みツールは9種類、システムプロンプトは2kトークンと小さい。
SoL-Piのハーネス最適化. NvidiaのSoL-Piは、コーディングエージェントのハーネスを自動で最適化し、性能を保ったままトークン使用量をほぼ半分に減らす。152の方向性を探索して、ツール利用とコンテキスト管理の制御ロジックをより無駄の少ない形に導く。
ビジネスと業界
Geminiで直接購入テスト. Googleはインドで、Walmart傘下のFlipkartからの直接購入をGeminiとAI Modeの中でテストし始めた。AIの画面を離れずに決済に進める「Buy」ボタンが表示される。テストは限定的で、祝祭商戦を前に拡大する見通しだ。
医療AIで請求費が増. Blue Cross Blue Shield Associationの分析によると、病院がAIを使って診療報酬請求をコーディングしたことで、2年間で9億4200万ドルの医療費が上乗せされた。診断はより複雑になったが、提供されるケアが変わった証拠はない。保険会社はこの構図を「bot同士の戦い」と表現している。
Cloudflareのbot対策. Cloudflareは、インターネットトラフィックの半分以上をbotが占めるようになったとしている。同社のプラットフォームでは、サイト運営者がAIエージェントをブロックしたり、許可したり、課金したりできる。CEOのMatthew Prince氏はインタビューで、サイトとAIエージェントの間に立つ同社の位置づけを語った。
対話型AIアバター. Synthesiaは、自社のコーポレートアフェアーズ担当責任者の対話型デジタルアバターを作り、報道陣の質問に答えさせた。記事の筆者も自分のアバターを自作している。企業価値40億ドルの同社は、企業研修やロールプレイ向けにAIアバターを提供する。
ウクライナのロボット化. ウクライナの元国防相Mykhailo Fedorov氏は、戦場の全面ロボット化を目指す民間主導の取り組みを発表した。標的との交戦の95%以上はドローンが担っているという。防衛テック企業への投資に加え、自らもプロジェクトを立ち上げる。
AIのROIは小幅. ある事例的な調査では、ITリーダーの3分の2がAIで測定可能な成果を上げたと答えた。ただ、CEOの休暇を中断させるほど大きな成果はほとんどなかった。AIのリターンが継続的なインフラ投資に見合うのかという、ぎりぎりの均衡の問いを映し出している。
研究とベンチマーク
AI依存をめぐる実験. 5つの実験で、ほとんど誤った答えを出す言語モデルを利用できると、被験者が「わからない」と答える意欲がほぼ失われ、AIの回答に従ってしまうことがわかった。AIの助言が頻繁に間違っていても効果は変わらなかった。
GPT-6 Astraの視覚. OpenAIのGPT-6 Astraは、Epoch AIのFurniture Assembly Benchmarkで80%を獲得した。10カ月前の最高モデルは28%だった。写真からIKEA家具の組み立てミスを特定できる。リアルタイムの支援にはまだ遅すぎるが、視覚的推論の急速な進歩を示している。
Julia-1はローカル分類器. SupersonicLabsは、144Mパラメータの多言語エンコーダ「Julia-1」を公開した。質問への回答候補を選び分け、CPUで動く。小規模な意思決定タスク向けだ。選択肢が変わっても分類・順位付け・yes/no回答をこなすモデルの研究として、最初の成果にあたる。
ローカルAIとモデル
Splash 1.1.0. Splash 1.1.0はGGUF量子化とMLXインポートを追加した。最適化カーネル、投機的デコーディング、プレフィックスキャッシュを組み合わせ、Apple Siliconでの推論を高速化する。ユーザーによれば、M5 ProでQwen3.8 27Bが50トークン/秒で動くという。
Overspillのディスク階層. FreeTokenのディスク階層Overspillは、12GBのRTX 3060と64GBのRAMで、85GBのDeepSeek-V4-Flash MoEモデルを約3トークン/秒で動かした。報告されているテストではllama.cppとColibriを上回る。実験的なプロジェクトで、Colibriに着想を得ている。
TensorSharpがQwen-Image対応. TensorSharpはQwen-Image 2.1をローカルで動かせるようになり、テキストからの画像生成と編集に対応した。高速サンプリングのレシピを使うLoRAアダプタも含む。通常のスタイルLoRAと編集LoRAをサポートする。
今日はこれで全て - 約5分の読み物です。