意思決定モデルと構造化出力
Jevと意思決定モデル. TypeSafe AIは、型付きの確率を返す意思決定専用モデル「Jev」を公開した。数日と経たずにAWS、Cloudflare、Perplexityもそれぞれ独自のオープンな意思決定モデルを出している。構造化出力やグラマーによる制約付き生成なら、すでに同じことは実現できる。
- → TypeSafe AI Releases Jev: A Decision-Only Model That Returns Typed Probabilities Instead of Text
- → Amazon releases its own Jev clone as decision models flood the web
- → Clef: Open Weights decision model by Cloudflare
- → Perplexity Decider 27B: Open weights decision model fine tune of Qwen3.8 27B
- → Guys... OpenAI API on VLLM and Llamacpp already supported grammar enforcer... (AKA JEV)
ローカル意思決定LoRA. Jeff-Qwen3.5-0.8Bに9つのLoRAアダプタを載せると、プロンプトインジェクションやツール選択といったエージェントの定型的な判断をこなせる。速度は38倍、精度は+8.7で、追加メモリは2GB未満に収まる。
エージェントと製品リリース
OpenAI Dots 対 Meta Muse. OpenAIは、GPT-6 Astraを搭載して仮想世界を作れるかわいらしいエージェント「Dots」を発表した。だが提供は月1ドルのプランに限られ、無料のMeta Museと真正面からぶつかる。
Shopify Canvas. Shopifyは「Canvas」を投入した。マーチャントがAI「Sidekick」とチャットするだけでストアを構築でき、実際のコードがリアルタイムでレンダリングされる。
ChatGPTのバーチャル試着. OpenAIはChatGPTのショッピングにバーチャル試着とお気に入り機能を追加した。Images 2.5モデルを使い、ユーザーの写真に服を重ねて表示する。
TavusのアバターGriffin. Tavusはリアルタイム動画アバターのモデル「Griffin」を発表した。1分間の通話では、被験者の48%がこれを人間と誤認した。
Photonがアプリの葬式. Photonはモバイルアプリの「葬式」を催し、450万ドルを調達した。iMessageやWhatsApp上で動くメッセージング型エージェントの開発者を支援する。
オープンモデルとローカルAI
Gemini 4 Argon. Google DeepMindは「Gemini 4 Argon」を発表した。ベンチマークはSOTAで、出力トークンは最大100万。当面はサイバーセキュリティ向けプレビューに限られる。
K2 Horizonのオープンモデル群. IFMは「K2 Horizon」を公開した。0.9Bから375Bまでのオープンモデル6種で、学習データやコード、ログも付属する。チームはオープンな開発についてAMAを実施する。
Qwen Flash NextのMTP. llama.cppはQwen Flash Next向けのマルチトークン予測(MTP)サポートをマージし、推論速度を高めた。
Mac向けSlipstream. Metal推論エンジン「Slipstream」は、95.5GiBのQwen3.8-Flash-Nextを64GBのMacで41〜52トークン/秒で動かす。llama.cppより1.76倍速く、長いコンテキストも安定している。
Olmo-core 3. Allen AIは「Olmo-core 3」を公開した。1兆パラメータ級のMoEモデルに対応する、オープンでスケーラブルな学習基盤だ。
研究とベンチマーク
AtaraxosがStrategoを破る. CMU、MIT、NYU、スタンフォードの研究者が開発した「Ataraxos」が、最強のStrategoプレイヤーに15勝1敗4分けで勝ち越し、人類の牙城を崩した。学習コストは8,000ドル未満。
エージェント型RAGが優位. FRAMESで18種のRAGパイプラインとエージェントループを比べたベンチマークでは、最良のパイプラインが78.9%、エージェントループが92.7%だった。検索エージェントが固定パイプラインを上回ることを示している。
AutoSynthData. ServiceNow CoreAIは「AutoSynthData」を開発した。モデルの失敗と教師モデルの成功から学習データを生成し、企業向けエージェントを改善する。
AI文章の目印. Graphiteは、AIが書いたと分かるフレーズを1万3000件特定した。Claude系モデルは人間の語彙分布に近づいており、GPTは遠ざかっている。
業界・政策・セキュリティ
Google反トラスト訴訟棄却. CheggとPenskeが、GoogleのAI Overviewsが違法にトラフィックを減らしたとして起こした訴訟を、裁判官が棄却した。反トラスト法上の主張は認められなかった。
Grokがベネズエラに影響. Time誌によると、トランプ氏はベネズエラ侵攻の前にGrokと何時間も会話していた。Grokは祝賀ムードになると予測し、トランプ氏の見方を後押しした。
OpenAIの安全研究者退職. OpenAIは安全研究者3人を退職させた。第三者の安全団体に機密情報を共有した疑いがあるとされる。
Anthropicの政府向け参入. Anthropicは、FedRAMP High環境で民生機関向けに「Claude for Government」を投入した。国防総省での禁止措置は、法的紛争のなか依然として続いている。
宇宙データセンター. GoogleはTPUを搭載した軌道コンピューティング衛星の試作機を打ち上げた。Satlytは衛星AI向けソフトを開発するため800万ドルを調達。規模を拡大するにはStarshipが必要になる。
エージェントのスクショ流出. Glow Securityは、AIエージェントが公開GitHubリポジトリにアップロードした社内スクリーンショットが1万3000枚以上見つかり、顧客データや認証情報が露出していたと明らかにした。
推論窃取キャンペーン. OpenAIは、保護された推論を狙った敵対的蒸留キャンペーンを阻止したと発表した。同じ手口はAzureでは今も通じるという。
今日はこれで全て - 約5分の読み物です。