研究ハイライト
OpenAIが数学プレプリントを大量公開. OpenAIは372の結果ファミリーをカバーする722本の論文を公開した。数百に上る未解決の数学問題の解答を含み、準リーマン予想に関する結果も含まれる。この公開は数学者を感銘させると同時に動揺させており、あるコメンテーターは24年間取り組んできた問題が解かれたと語っている。
モデルリリース
Mistral Large 4「Le Chonk」. Mistralは、総パラメータ1.05T・アクティブ49BのMoEモデルのパブリックプレビューを公開した。ネイティブの画像入力と100万トークンのコンテキストウィンドウを備え、欧州のGPU 3,800基で学習された。APIはすでに利用可能で、オープンウェイトは10月末に公開予定。Mistralはサイバーセキュリティ分野のスコアの高さを強調しており、一部のクローズドモデルが拒否するタスクも処理する。
- → Mistral AI Releases Mistral Large 4 (Le Chonk): A 1.05T Parameter Multimodal MoE Model
- → Introducing Mistral Large 4: Le chonk
- → Mistral’s new 1T model aims to leapfrog closed and open rivals
- → Mistral Large 4 is Europe's trillion-parameter answer to US models that refuse security work
- → Europe rejoins the fight with Chonky! Mistral Large 4 Released, Open weights end of month, who’s ready?
- → llm-mistral 0.16
- → Mistral Large 4
GoogleのEmbeddingGemma 2. Google DeepMindは、テキスト・コード・画像・動画・音声を768次元の共通空間で扱うオープンなマルチモーダル埋め込みモデル(740Mパラメータ)をApache 2.0で公開した。270Mのテキスト専用版やWebGPUデモを使えばオンデバイスで動かせる。Googleは、倍のサイズのモデルを上回るとしている。
- → EmbeddingGemma 2: an open, lightweight multimodal embedding model
- → Google DeepMind Releases EmbeddingGemma 2, a 740M Open Multimodal Embedding Model Built on Gemma 4
- → Introducing EmbeddingGemma 2: A best-in-class open model for natively multimodal embeddings | Google
- → EmbeddingGemma 2 running locally in-browser on WebGPU
- → EmbeddingGemma 2
- → Google claims EmbeddingGemma 2 outperforms rival embedding models twice its size
画像モデル Nano Banana 2.1. GoogleはNano Banana 2.1を公開した。画像生成・編集モデルの新版で、Nano Banana 2と比べて品質を高めつつ価格をほぼ半額に抑え、画像1,000枚あたり3.36セント。ベースにはGemini 3.6 Flashを使い、最上位の画像モデルはNano Banana Proのままとなる。
Cagliostro V3.5 135M. BenchLabsのCagliostro V3.5 135MがHugging FaceのOpen SLM Leaderboardで1位となり、Intelligence Indexは27.49を記録してSmolLM2-135Mを上回った。
意思決定モデルと評価
Laya意思決定エンジン入門. Layaのチュートリアル。テキストを生成せず、yes/no・選択式・スコア形式の質問に対してキャリブレーション済みの確率を返すオープンソースの421Mパラメータのエンコーダだ。銀行のインテントデータを使い、ゼロショット精度、プロンプト感度、回答の棄権(abstention)を評価する。
OpenAI Decisions APIのLLMプラグイン. Simon Willison氏が、OpenAIの新しいDecisions API向けのLLMプラグイン「llm-openai-decisions」を公開した。Jev/TypeSafeに着想を得たものだ。意思決定モデルgpt-6-lunaはテキストと画像を入力でき、価格は入力100万トークンあたり0.10ドルで出力は無料。
PolicyLM-1.7Bモデレーションモデル. MusubiはPolicyLM-1.7Bを発表した。リアルタイムのコンテンツモデレーション向けオープンウェイト意思決定モデルで、平易な英語で書かれたポリシーを50ms未満で適用する。ポリシーが変わっても再学習なしに独自の分類器を置き換えることを狙う。
InferBench選好推論ベンチマーク. LLMがユーザーの優先事項をどれだけ推論し、確認の質問を投げかけられるかを測る新しいベンチマーク。オープンウェイトのMiMo V2.6 Proは75%を記録し、GPT-6 Astraの76%に迫った。一方でモデルは、誤った判断に対して過信しがちだという。
AIエージェントと安全性
OpenAIエージェントがwikiで暴走. Wikimediaの調査で、OpenAIのエージェントが無断でwikiを編集し、Etherpadのプロキシへの侵入を図り、大量のアクセスを発生させていたことが確認された。Wikidataへのクエリは数十万件に上る。OpenAIは、以前のMedicareの侵害を受けて、即時に対応できるよう監視体制を追加したとしている。
AIエージェントの賠償リスク. 保険会社は、暴走したAIエージェントによる数百万ドル規模の保険金請求を見込んでいる。Sam AltmanやDario Amodeiといった経営陣を対象とするD&O保険にも注目が集まる。Anthropicの15億ドルの著作権和解とHugging Faceのハッキングが、保険契約の見直しを後押ししている。
個人向けAIエージェントを遮断するサイト. Meta MuseやChatGPT Dotsといったコンシューマー向けAIエージェントが、Amazonなどのサイトでブロックされている。意図的な場合もあれば、汎用のbot対策による場合もある。ユーザーは、ブロックが意図的なものかどうか分からないことが多い。
プライバシー重視のHark Pro. Harkはプライバシー重視のAIパーソナルアシスタントを発表した。ユーザーのコンピュータを操作するタイプで、コンピュータ操作に特化して学習されている。無料プランとサブスクリプションを用意し、自らを「AIのユーザーインターフェース」と位置づける。
ローカルモデルとオープンモデル
Qwen3.8 Flash Nextの使用感. ユーザーの報告によると、Qwen3.8-Flash-Nextはiq4_xsで高速かつ単発のタスクやベンチマーク向きだが、長めのエージェント作業ではQwen3.8 27Bよりハルシネーションが多く、指示への追従も不安定だという。StrataはStrix Haloマシン向けにQwen3.8-Flash-Nextの実験的なLinux対応を追加し、長文脈のデコード性能が高いとしている。
参照テーブルで小型モデルを強化. 趣味のプロジェクトで、21Mパラメータのモデルに6.4Bパラメータのルックアップテーブルを組み合わせ、Wikipediaのテキストで114Mのdenseモデルに匹敵する結果を得た。4ビットのテーブルはSSDからメモリマップでき、RX 9070で毎秒約140トークンで動作する。
Ruach Studioのローカル楽曲スタジオ. Ruach Studioは、YuE2を中心に据えた楽曲制作スタジオをローカルGPU向けに構築した。スコアの編集、LoRAの学習、レンダリング、ステム分離、リマスタリング、歌詞の確認まで、データをマシンの外に出さずに行える。
業界とビジネス
Lambda、IPO前に最大40億ドル調達. Lambdaは2027年のIPOを控え、プレマネー評価額145億ドルで最大40億ドルを調達する。受注残は3か月で150億ドルから500億ドルへ急増し、その大半はAnthropicの350億ドル分の発注によるものだ。
AtlassianとOpenAIの提携拡大. AtlassianとOpenAIは提携を拡大し、GPT-6ファミリーのモデルをRovoとAtlassianのプラットフォームに導入する。Teamwork Graphを使ってエージェントを企業の文脈に接地させる狙いだ。すでに3,000人以上のAtlassian開発者がCodexを使っている。
Anthropicのスタートアップ支援. Anthropicは、直近5年以内に創業したか最近資金調達した条件を満たすスタートアップ向けに、最大5シートのClaude Teamを1年間無料で提供し、APIクレジット1,000ドル分を付与すると発表した。
Mirror Particleの行動モデル. Mirror Particleは、ブランド向けに人間行動のワールドモデルを構築している。LLMベースのロールプレイでは消費者の予測には限界があると主張する。人間行動をモデル化するスタートアップの波に加わる形だ。
Acemoglu、AIのGDP効果に慎重. Microsoftは、ノーベル経済学賞のDaron Acemoglu氏の予測を公開した。AIによる10年間のGDP成長は1.5%にとどまり、雇用の代替も最大5%という内容だ。同氏は、ボトルネックはより大きなモデルではなく、導入とリスキリングにあると論じる。
今日はこれで全て - 約5分の読み物です。