ローカルモデルとエージェントワークロード
Qwen3.8 27B ローカル. コミュニティのテストで、Qwen3.8 27BはQwen3.6より指示追従と長文脈タスクが強いことが判明。RTX 5090 1枚なら、262Kコンテキスト対応のNVFP4版を実行でき、短いコンテキストで77トークン/秒、128Kで65トークン/秒となる。
投機的デコード. DFlash 2はn-gramドラフターを使い、Qwen3.8 27BではLiveCodeBenchプロンプトで2.26倍、長いコーディングセッションで最大4.68倍の高速化を達成。Ornith 35Bでは固定MTPヘッドにより実時間が3分の1短縮された。
再帰的コンテキスト管理. 開発者たちは、高速な64Kメインエージェントと再帰的サブエージェント、小型コンプレッサーモデルを組み合わせ、300Kコンテキストにコストを払わずにはるかに長いタスクを処理している。
Gemmaツール呼び出しチューニング. Gemma 4 12Bをツール呼び出しとCLI利用向けにファインチューニングしたモデルは、ツール使用を2.7倍に改善し、ツール呼び出し試行回数を15.7%増加させた。16GB VRAM環境を対象とする。
DGX Spark クラスタ. 36ノードのDGX Sparkクラスタがエージェント能力クラスタとして運用され、ノードをSOTAモデル、リランク/埋め込み、動画、画像、音声の各処理に同時に割り当てている。
ツールとフレームワーク
llama.cpp 0.2.0. llama.cpp 0.2.0は、ローカル推論用のプリビルドと最新のアップストリーム変更を同梱してリリースされた。
Cloudflare Kitesurf. Kitesurfは、WebAssembly/Rust Workers上に構築され、ページごとに分離されたDOMを持つエージェント向けブラウザエンジン。CDPをサポートするため、PlaywrightやPuppeteerからフルChromiumより低いオーバーヘッドで操作できる。
llm 0.33. Simon Willisonのllm 0.33は、埋め込みモデル向けの呼び出しごとのAPIキー、モデル設定とプロンプトを組み合わせる繰り返し利用可能なテンプレート、推論モデル向けのreasoning_summaryオプションを追加。
コーディングエージェントの実践. Simon Willisonは、コーディングエージェントに必要なのは、変更を自信を持って指示し検証するスキルだと論じる。Linus Torvaldsは、困難なデバッグセッションで雑務をこなしたものの、問題は解決不能だと繰り返し主張して後押しが必要だったAIを紹介している。
研究と手法
プレイブックとしてのスキル. 8,135回のテスト実行で、エージェントスキルは主に信頼できるプロセスを与えることで役立ち、事実を与えることではなかった。手続き的グラウンディングは改善の65.7%を占め、タスクが学習済みプロセスから逸れるとスキルは失敗した。
心的世界モデル. 新しい研究は、MENTISによってAIの世界モデルに人間の信念と意図を追加する。物理的・心的・社会的な妥当性をモデル化することで、人間の行動予測が大幅に改善される。
安全ベンチマークの心理測定. 8つの安全性ベンチマークの計量心理学的分析により、単一のスコアは拒否の厳格さ、真実性、文脈上の害の間のトレードオフを隠すことが判明。モデルは過剰ブロックによって安全性スコアを水増しできる。
可逆的CoT. サイクル一貫性チェックと逆計算を備えた近似的に可逆な推論ステップの提案は、幻覚を検出し、エッジLLMのKVキャッシュメモリを削減できる可能性がある。
すべてをシミュレーション. Latent Spaceは、合成データ、ルーブリック、環境によってMLパイプラインの各コンポーネントがモデル製になりつつあり、人間のシミュレーションに比べて精度は10%劣るものの、コストは100分の1、速度は1万倍で近似できると論じる。
業界と応用
Inherent Faraday. DeepMind出身者のスタートアップInherentは、自社エージェントFaradayが、公開済みの科学的研究成果を独立に再現するタスクでAnthropicとOpenAIのモデルを上回り、モデルサイズはごく一部で済むと発表した。
LinkedInのAIレビュー. LinkedInは、フィードバックを差分とコードベース規約に基づかせるマルチエージェントAIコードレビュープラットフォームを構築し、幻覚や情報量の少ないコメントを減らした。
Netflix GenRec. Netflixの言語モデルによるレコメンドシステムGenRecは、ユーザー行動をテキストに変換し、オフラインとライブA/Bテストで手作りの特徴エンジンをはるかに少ないデータで上回った。
DoorDash SafeChat. DoorDashは、大規模に構築したマーケットプレイス安全システムSafeChatについて詳述し、それが機能し始めた後、より強力なアーキテクチャに置き換えた。
教育分野のAIアバター. ハーバード・ビジネス・スクールの699ドルのFoundryブートキャンプは、ピッチや取締役会のフィードバックにHeyGenのAIアバターを使用。参加者はガイド付きの体験を評価しているが、実際のインストラクターはそのレプリカが少し不気味だと話す。
モデルニュース. Liquid AIは100B LFMモデルへの関心を調査中。一方、Ox Alphaと呼ばれる謎のモデルは、コーディングとエージェント性能の高さで注目を集め、GLM系の派生ではないかと推測されている。
政策・安全性・信頼
OpenAI SB 53. OpenAIは、以前は法案に反対していたが、現在はカリフォルニア州がSB 53を修正し、フロンティアモデルの訓練中の監視とより強力なサイバーセキュリティを追加すべきだと述べている。
封じ込め計画. Guidelightの調査は、暴走モデルの封じ込めについて5つのフロンティア研究所を評価。OpenAIが最高、AnthropicとMetaが最低で、実証済みの対応計画を公開している研究所はほとんどない。
Claude透かし. AnthropicによるClaudeテキスト出力の新たな透かしについて、適用方法とできること・できないことが詳しく解説された。
クローズドモデルの信頼. Redditのr/LocalLLaMAスレッドは、OpenAIが学校の課題をわざと低い性能で処理し、ユーザーエンパワーメントから離れつつあり、実務家をエージェントループ向けのローカルモデルへと押し戻していると論じている。
今日はこれで全て - 約5分の読み物です。