モデルリリースとローカルAI
Sori-1B音声音語モデル. 音声と対になるテキストのみでゼロから学習した1Bパラメータのモデルで、テキストのみの事前学習は行わず、回答を音声に基づかせることを目指す。NVIDIAの凍結したAudio Flamingo Nextエンコーダーと独自の聴覚オントロジートークナイザーを使用し、非商用・学術向けライセンスで公開されている。
Qwen3.8ローカル活用の波. コミュニティの報告では、Qwen3.8-27BとFlash Nextが、12GBスマートフォン(3.5トークン/秒)からR9700 GPU 4枚(生成時80〜120トークン/秒、コンテキスト700k)まで、さまざまなハードウェアで動作している。ローカルエージェントのワークロードでは、Flash Nextは高速で動作も安定している。一方、denseな27Bは長時間のマルチターン利用で依然として強力だ。一部のユーザーはモデルが鈍いと感じるが、ドイツ語翻訳の品質は評価されている。
- → Qwen3.8-Flash-Next-NVFP4 vs Qwen3.8-27B-FP Test Results
- → Qwen 3.8 27B - Fantastic German capabilities
- → Unpopular opinion Qwen 3.8 is hard to understand
- → Qwen 3.8 Flash Next locally on simple mobile phone at 3.5 tok/s
- → Here my pretty good qwen3.8 27B setup, hope it helps
- → Qwen3.8-Flash-Next turns 4xR9700 into a local AI powerhouse! 120 t/s TG and 12k t/s PP single request with optimized vLLM
アンセンサードGGUF公開. Redditユーザーが、69B-A3Bのスパースアテンションモデルで1MコンテキストのLongCat-Flash-Lite-Sparseに加え、MTP付きQwen3.8-27B、Qwen3.5-122B-A10B、Qwen3-Coder-Next、ビジョンモデルのGGUFを公開した。LongCatのサポートにはカスタム版のllama.cppフォークが必要。
デスクトップ向けAIハードウェア. NVIDIAのDGX Stationデスクトップは、7.1TB/秒のメモリ帯域幅でデータセンター級の性能を実現する。一方Frameworkは、約4,500ドルと見込まれる192GBメモリ搭載マザーボードを準備しているようだ。
ベンチマークと評価
LLMペンテストベンチマーク. 新しいベンチマークは、LLMに実際のインフラを攻撃させて評価し、既知のCVEの再現ではなく、攻撃的セキュリティ業務に最適なモデルを見つけることを目的としている。
コーディングベンチマーク指数. Redditユーザーが主要なエージェント型コーディングベンチマークを「Agentic Coding Index」に統合し、パラメータあたりのモデル能力を比較するための知能密度指標を算出した。
オープンVLMの一人称視点評価. 一人称視点ビデオのベンチマークでHFlowを使用した結果、オープンなGemma VLMは、手の可視性と操作の各指標でGemini 2.5 Flashに匹敵し、コストは19分の1だった。プライベートなセルフホスト処理が実用的になる。
ツールとエージェントフレームワーク
Cloudflare AI Search. CloudflareのAI Searchは、カスタムデータ向けのエンドツーエンドの検索パイプラインを提供するようになった。エージェント連携、マルチモーダル検索、サイトマップなしでサイトをインデックスできるDiscoverモードを備える。
AWS Kiro Crew. AWSは、共有メモリ、再利用可能なスキル、スケジュールジョブを備え、複数の非同期コーディングエージェントを実行するためのワークスペース「Kiro Crew」をオープンソース化した。社内では3万9,000人以上の開発者が利用している。
ChatGPT Work解説. OpenAIのChatGPT Workは、有料プランで利用でき、chatgpt.com経由のクラウド版と、ファイルにアクセスしてプログラムを実行できるローカルデスクトップ版がある。ただ、Chatとの境界は依然として分かりにくい。
Claude Code利用上限削減. AnthropicがClaude Codeのベースライン利用上限を25%引き上げる予定だが、現在の一時的な50%増と比較すると、実質17%の削減となる。また、自動バグレポートツールも追加された。
研究と分析
エージェントの時間認識不足. ある研究によると、Claude CodeとCodexはタスクの所要時間を一貫して誤って見積もり、短いタスクを3〜10倍過大評価する。長時間実行するエージェントジョブにとっては問題となる。
PILOTライブ自己改善. PILOTは、長期的なタスクを実行するエージェントにライブ誘導とライブ自己進化を追加するスーパーバイザー・ワーカー型ハーネスだ。Terminal-Bench 2.0では、同等のハーネスを最大9.8ポイント上回った。
GameWAMワールドアクションモデル. GameWAMは、実ゲーム映像を対象とする初のワールドアクションモデルだ。フローマッチングにより将来フレームとキーボード・マウス操作を同時に生成し、長期的なブロックサイクル制御を実現する。
次チャンク推論RL vs SFT. 対照実験により、no-CoTデータとlong-CoTデータを混合したMixed SFTが、pre-RLVRのトレーニング戦略として次チャンク推論RLを上回り、計算量は60分の1以下であることが示された。
AIエージェンシーをめぐる議論. 7月のHugging Face事件を引き合いに出し、ある論考は、AIの成果を左右するのは能力だけでなくAIのエージェンシー(行為主体性)であり、ユーザーがそのエージェンシーをどう与え、どう制約するかが重要だと主張している。
業界・政策・ビジネス
NVIDIA、Hugging Face買収. NVIDIAによるHugging Face買収は129億ドル規模と報じられている。この買収は、計算インフラとオープンモデルエコシステムの主要な配布ハブを結びつけ、AIの産業化を加速させることになる。
米国のロボット貿易障壁. 米政府は国家安全保障を理由に、中国製ドローンとロボットに対する規制と関税を強化した。ただし、中国の製造規模とコスト優位性が世界的な影響を弱める可能性がある。
産業現場へのAI導入. Metaはデータセンターで、サーバーリセット、ケーブル交換、電源再投入のためにWatney、Kinova、ABBのロボットをテストしている。Caterpillarは鉱業での自律化のノウハウを建設業に応用し、技術者向けのAIアシスタントも導入している。
マスク氏、タービン部品内製へ. SpaceXはガスタービンの動翼と静翼を製造する鋳造所を建設中だ。マスク氏は、社内鋳造によりAIデータセンター向けの天然ガス発電を最大18か月加速できると述べている。
労働者のAI肯定感低下. Glassdoorのデータによると、米国の労働者がAIに対して肯定的な感情を持つ割合は、2019年の81%から2026年半ばには43%に低下した。管理職が最も楽観的で、Z世代の女性、ライター、保険業界の労働者が最も否定的だ。
音楽出版社、Anthropic提訴. ソニー・ミュージック、ワーナー・ミュージックなどが、AnthropicがClaudeの訓練のために数万件の著作権付き歌詞を違法にトレントで取得したと主張し、CEOのDario Amodei氏と共同創業者のBenjamin Mann氏を個人として名指ししている。
テキサス州、Flockカメラ支出凍結. アボット知事は、3,000万ドル以上が費やされた後、超党派のプライバシー懸念や警官による不適切使用事件を背景に、FlockのAI監視カメラへの州支出を凍結した。
今日はこれで全て - 約5分の読み物です。