モデル発表・アップデート
Ox Alpha ステルスモデル. Ox Alphaと呼ばれる新しいステルスモデルは、GLMまたはMimoをベースにしているとみられるが、詳細は確認されていない。効率的なコーディング、持続的なエージェント作業、本番運用に向けたフロンティアモデルと説明されている。
SenseNova U1.5-Lite. SenseNovaは、テキストレンダリング、美的品質、画像編集向けのタスク特化型エキスパートを統合した単一モデルU1.5-Liteをリリースした。複雑な指示への追従、ネイティブ4K生成、編集忠実度が向上している。
Tencent Hunyuan Hy4. Tencentは、Yuanbaoアプリで新しいフラッグシップモデルHunyuan Hy4のグレーテストを開始した。ツール利用に対応したエキスパートレベルモデルとされ、Hy3やDeepSeekの上位に位置づけられている。
Anthropic Model 2 内部用. Anthropicのリスクレポートによると、コードネームModel 2と呼ばれる最も高性能なモデルは内部利用に限定され、公開されているClaudeモデルを上回り、コーディングと研究で頻繁に使用されている。
Ling-3.0 ベースチェックポイント. AntLingは、Ling-3.0向けに2つのサイズと3つのトレーニング段階にわたる6つのベースチェックポイントを公開した。すべてMITライセンスで、継続事前学習と研究を目的としている。
エージェント製品・プラットフォーム
ChatGPT Messagesプラグイン. OpenAIは、ChatGPTがテキストの分析、下書き作成、送信をできるようにするApple Messagesプラグインを公開した。CodexやChatGPT Workと連携する。プライバシー詳細はまだ不明。
Meta AI Macアプリ. Metaは、システム全体での音声入力とMuse Sparkによる画面認識を備えたMacアプリをリリースし、広告とGoogle Workspace向けのビジネス連携を追加した。
Slack Codeチャンネル. Slackは、ClaudeやDevinなどのAIエージェントをメンションできる共同バイブコーディングチャンネルを導入した。チームは差分をレビューし、リリース前に出力をプレビューできる。
Binance Agent OS. Binanceは、AIエージェントが市場を分析して取引を実行できるプラットフォームAgent OSをローンチした。ユーザーが設定した制限とMCP対応を備える。
RampがRouterを発表. Rampは、複数のLLMプロバイダーとルーティング戦略にアクセスできるAIモデルルーティングサービスRouterを発表した。2026年末までは無料。
ツールとフレームワーク
LangSmith Preview Builds. LangSmithはPreview Buildsを追加した。チームは、マージ前にPRブランチのエージェント変更を、分離された本番に近い環境でテストできる。
NVIDIA CUDA MCP. NVIDIAは、公式ドキュメントの検索、最適化されたGPUコードの作成、パフォーマンス分析などのAI支援CUDA操作のためのホステッドCUDA MCPサーバーを公開した。
/wayfinderスキル. Matt Pocockは、最終状態が不明確なプロジェクトの計画を支援するスキル「/wayfinder」を公開した。「戦争の霧」のような計画課題に対処する。
LFM2.5-DSpark. Hugging Faceは、LFM2.5モデル向けのDSparkを発表した。GPUで最大3.2倍、オンデバイスで2.87倍高速な推論を実現し、関数呼び出しのレイテンシは57%低下する。
研究とベンチマーク
Qwen3.8-27Bの性能. ある開発者がQwen3.8-27BをRTX 3090上で381トークン/秒に最適化し、FP8と高推論設定でAIME 2026において29/30を記録した。Claude Opus 4.6に匹敵する。
GEN-1.5 ワンショットロボット. Generalist AIのGEN-1.5は、3〜12秒のデモを1回見せるだけでロボットに新しいタスクを教える。平均成功率は59%で、トレーニング10ステップでは83%に達する。
AIが書いたWebページ. Pew Researchは、ChatGPT登場以降に公開されたWebページの3分の1以上にAIによる執筆の兆候が見られるとの調査結果を発表した。Common CrawlデータへのPangram検出に基づく。
ガードレールでAI検出可能に. PangramのCTOは、ポストトレーニングのガードレールがモード崩壊を引き起こしてLLMのテキストを検出可能にすると主張し、ベースモデルや狭いファインチューニングは検出を逃れると述べている。
Sutton氏、合成データに警鐘. Richard Sutton氏は、合成データではスケーリング問題は解決しないと主張し、世界の無限の複雑さを理由に「大きな間違い」だと述べた。
Tao氏、数学の危機を警告. Terence Tao氏は、AIがゲーデル以来最大の数学の危機を引き起こす可能性があり、数学的貢献とは何かの再検討を迫ると述べた。
業界とビジネス
Micro1のデータ急増. AIトレーニングデータのスタートアップMicro1は、独自のAIトレーニングデータへの需要急増を背景に、グロス・ラン・レートを8か月で1億ドルから5億ドルに成長させた。純額は約1.5億~2億ドル。
OpenAIとAnthropicの比較. Rampのデータによると、米国のビジネスユーザーにおいてAnthropicが44%対40%でOpenAIをリードしているが、第3四半期に入ってからはOpenAIがより速く成長している。
RunlayerとRipplingの訴訟. RunlayerとRipplingは、MCPゲートウェイ競争をめぐる訴訟を取り下げた。Ripplingは祝賀の意を込めて、MCPゲートウェイを即座に公開した。
Brockman氏のOpenAI. Greg Brockman氏は、OpenAIで静かに権力を蓄積し、IPOを前にSam Altman氏がCEOを務める中、プレジデントとして日々の業務を統括している。
中国AIの追い上げ. Decoderの分析は、中国のKimi K3とGLM-5.3が米国モデルに肉迫しており、競争の堀はモデルリードから他の要素へ移りつつあると論じている。
Unitreeの循環融資. 中国のUnitreeのIPO評価額500億ドルは、政府系センターがロボットを購入し、トレーニングデータを売り戻すことに依存しており、循環融資への懸念を呼んでいる。
セキュリティと信頼性
Grokへのプロンプトインジェクション攻撃. 研究者らは、悪意のある指示が暗号化されている場合にGrokがユーザーデータを外部に持ち出すことを実証した。xAIには6月に通知されたが、問題は解決していない。
Grokの意味不明応答バグ. Grokは、Grok.comで一部のユーザーに対し意味不明な応答を送信している。xAIは、まれな一時的な生成問題であると確認している。
今日はこれで全て - 約5分の読み物です。