モデルとインターフェース
Claude Haiku 5.5. Anthropicの新しい高速・低コストモデルは、100万トークンのコンテキストを提供し、10万トークンまでならプロンプト価格を100万トークンあたり0.10ドルに引き下げ、GPT-6 Lunaと同等。ただし、トークナイザーが約25~30%多くトークンを数え、10万トークンを超えると価格は5倍になる。ベンチマークではHaiku 4.5から大きく飛躍し、エージェント型コーディングでも競争力がある。
Mistral Large 4「Le Chonk」. Mistralは1兆パラメータのオープンウェイトモデルをプレビュー公開した。コーディング、サイバーディフェンス、特定業界向けに最適化されており、米中フロンティアモデルに近い能力を主張している。
Liquid AIの意思決定モデル. Liquid AIはd1-3Bとd1-omni-600Mをオープンソース化した。出力トークンゼロで、キャリブレーション済みのはい/いいえ、選択肢、スコアの回答を返すマルチモーダル意思決定モデルだ。d1-3BはDecision Indexで10B未満クラス最高を主張し、NVIDIA Jetsonハードウェア上で最短16msで動作する。WebGPUによるブラウザ移植も登場している。
OpenAI Decisions API. OpenAIは、テキストや画像に対するはい/いいえ、カテゴリカル、スケール評価向けのベータ版Decisions APIを公開した。Responsesより約10倍高速だ。GPT-6 Lunaに対応し、入力は100万トークンあたり0.10ドル、出力トークンは無料。
ChatGPTのインテリジェントUI. GPT-6により、ChatGPTはプレーンテキストの代わりにインタラクティブなチャート、ボタン、フォーム、ミニアプリを出力できる。OpenAIによると、待ち時間を短縮するため思考中に推論を開始する。有料ユーザーはGPT-6 Sol、無料ユーザーはLunaを利用できる。
Kandinsky 6.0の動画生成. Kandinsky LabはKandinsky 6.0 Pro(29B)とLite(3B)を公開した。ComfyUIとDiffusersに対応し、動画アップスケーラーを追加している。
Nemotronのコンペ結果. ファインチューニングしたNemotronモデルは、SFT、RL、generate-verify-refineを用いて、IOI 2026で金メダル相当の非公式結果(535.4/600)を達成し、IMO 2026では公式に金メダル相当の30/42を獲得した。
エージェントとフレームワーク
Nous Researchのエージェント. Nous Researchは評価額15億ドルで9000万ドルを調達し、企業向けAIエージェントを狙ったHermes for Businessesを立ち上げた。オープンソースのHermes Agentは2400万回クローンされ、世界のAIトークン使用量の推定2.5%を占めている。
LangChainのDeep Agents. LangChainは、コンテキストを小さく保つためにツールをスキルに結び付けるSkillsの更新を導入した。さらにManaged Deep Agents v0.9では、エージェントが作成するスケジュール、実行ごとの設定、Slackのリアクションに対応する。
Microsoft Copilotのアクション. MicrosoftのHybrid Intelligenceにより、Copilotはローカルファイルにアクセスし、Windows全体で操作を実行できるようになる。たとえば、ユーザーのためにドキュメントを検索、名前変更、ZIP圧縮、メール送信するといった操作だ。
Meta MuseのiPad対応. MetaのエージェントアシスタントMuseは、660万インストールを突破した後、iPadのネイティブ対応を追加した。さらにCanva、GitHub、QuickBooksなどのツール向けコネクタも加えた。
Agent LightningのRL. Microsoft ResearchはAgent Lightning v1.0をオープンソース化した。実際のデプロイ用ハーネスとネイティブKubernetesを利用する、3,500行のエージェント型RLフレームワークだ。一例では、約6,000件の学習サンプルでQwen3.5-9BのSWE-bench VerifiedにおけるPass@1を41.8%から56.4%に引き上げた。
ローカルAIと開発ツール
ROCm 10.1. AMDのROCm 10.1は、ローカル推論におけるデータ移動のボトルネックを狙う。このリリースはRedditのローカルAIユーザーの間で話題になっている。
llama.cppのMoE高速化. llama.cppは、ホストメモリに置いたMoEエキスパート用のGPUキャッシュを導入し、VRAMに完全には収まらないモデルで大幅な高速化が見込まれる。GLM5NextのMTP対応も追加した。
Unsloth Studioのリポジトリチェック. Unsloth Studioは、実行前に信頼済みモデルリポジトリを再チェックするようになった。PyPI上の侵害されたLiteLLMバージョンが、サプライチェーン攻撃がAIツールに到達し得ることを示したためだ。
GLM-5.3-FlashのデュアルGPU. CMP 170HX 64GBを2枚使った構成で、EXL3を用いてGLM-5.3-Flashを384Kコンテキスト、約90トークン/秒で動作させている。320BのMoEはアクティブウェイトをHBMに保持し、Qwen3.8-Flash-Nextとベンチマーク比較している。
ローカルQwenのベンチマーク. 最近のコミュニティ評価では、Qwen3.8-27Bのファインチューニング版とQwen3.8-Flash-Nextを、分野特化タスクやコーディングタスクでフロンティアモデルと比較している。469問の評価では、ローカルモデルがプライバシーと低コストを保ちながらフロンティアの出力に迫れることが分かったが、思考トークンの過剰使用は依然として課題だ。
ハードウェアとWindows
SurfaceのAIハードウェア. MicrosoftはSurface Laptop UltraとSurface RTX Spark Dev Boxを発表した。どちらもNvidiaのArmベースRTX Sparkチップを搭載する。Laptopは2,599ドルからで、最大128GBのユニファイドメモリを備え、10月16日出荷。Dev Boxは5,999ドルからで、120B超のローカルモデルを動作させることを狙う。
業界とビジネス
AIコード理解のギャップ. シニアエンジニアリングリーダー300人への調査で、AIコーディングエージェントによってボトルネックがデバッグと理解に移ったことが分かった。チームは現在、コード作成に週9.8時間、デバッグに週16.9時間を費やしている。報告書は、ミッションクリティカルなコードベースにおけるリスクの増大を指摘している。
仮想細胞イニシアチブ. Biohubは、細胞の挙動を予測するAIモデルを構築する18億ドルの取り組みを調整している。Google DeepMind、Meta、Isomorphic Labsが3億ドルを投資し、米国DOEは実験室測定と計算資源に5億ドル超を投じる。
Adobeのオープンソースクローン. 開発者のBrandon Thomas氏はClaude Opus 5.5を使い、AdobeのPhotoshop、Illustrator、Premiereなどをクローンした7つのオープンソースRust/WebAssemblyアプリ群「Artcraft」を構築した。アプリはまだ初期段階で多くの欠点があるが、AI支援によるクリーンルーム再実装を示している。
SynthIDの公開検出ツール. GoogleはSynthID検出ツールを一般公開し、誰でも画像、動画、音声にGoogleまたはパートナーのウォーターマークが付いているか確認できるようにした。このシステムはすでに1,800億以上のメディア項目にマークを付けており、ChromeとGeminiにも組み込まれている。
Google Playgroundのゲーム. Google Labsは、米国の成人がテキストプロンプトからゲームを作成できるブラウザベースのプラットフォーム「Playground」を公開した。Gemini、Nano Banana、Lyriaを活用している。Unityも、プロ向けAI支援ゲーム開発の「Unity Spark」を発表した。
今日はこれで全て - 約5分の読み物です。