モデルリリースとベンチマーク
Qwen 3.8 27B. AlibabaのApache-2ライセンスのQwen 3.8 27Bが利用可能になり、ハイエンドノートPCで動作します。Simon Willisonはこれを優れていると評価する一方、デフォルトの'xhigh'推論努力が過剰な思考を引き起こすと指摘しています。初期テストでは、複雑なアニメーションSVGタスクでGPT-5.6 Solを上回り、タートルグラフィックスでQwen 3.6から改善しています。一方、その推論ログには人間のようなフラストレーションが含まれることがあります。
- → Qwen 3.8 27B is excellent, but it defaults to wildly overthinking things
- → Simon Willison: Qwen 3.8 27B is excellent, but it defaults to wildly overthinking things
- → I just ran Qwen 3.8 27 in Q4 against GPT 5.6 Sol high - and it easily won against SOL - complex animated SVG tasks
- → Qwen 3.8 27b vs 3.6 27b - how good is with a Turtle library.
- → Anyone else get a kick out of Qwen 3.8 27B Reasoning Dialogue?
- → Share your favorite thoughts and reasoning from running Qwen 3.8 27b. This is mine.
推論努力のトレードオフ. 低・中・xhighの推論努力を簡単に比較すると、xhighはSVGの忠実度がはるかに高いものの、低と比べて約7倍の時間がかかります。低と中はほぼ同等です。
Audio.cpp 0.6. audio.cpp 0.6は、MiniMax-H3 text-to-audioとMiniMax-Music3を含む5つのモデルファミリーとネイティブWebUIを追加し、フレームワーク全体で49のモデルファミリーに対応します。
NVIDIA GB300スループット. Qwen 3.8 2.4Tは、NVIDIA GB300 NVL72上でFP8において、初日からGPUあたり毎秒4Kトークン以上、ユーザーあたり毎秒350トークンを達成します。
Qwen 35Bの削除. 最新のllama.cppコミットでQwen 35Bモデルが削除され、広く使われている35B MoEがリリースされないというコミュニティの懸念が裏付けられました。
ローカル推論とハードウェア
ローカルQwen最適化. コミュニティメンバーは、24GB VRAMでq8 KVキャッシュを使用してQwen 3.8 27Bを実行する設定を報告しており、RTX 3090単体でvLLMを使用して毎秒82トークンを達成しています。また、16GBカード向けのハイブリッドIQ4_XS量子化も報告されています。12GBのノートPC GPUでは、Q2は使用可能ですが品質が低下し、Q3は生成速度は遅いものの健全性テストの品質を維持します。
Llama.cpp ROCmアップグレード. Llama.cppはROCmを7.2から7.14に引き上げ、Radeon 780M iGPUサポートを有効にしました。ベンチマークでは、ROCmはプロンプト処理で高速ですが、Qwenモデルでのトークン生成ではVulkanがわずかに高速です。
エージェントツールとフレームワーク
AWS Dogwoodポリシー. AWSは、過去のアクションを遡って参照することでエージェントのツール呼び出しのシーケンスを管理する、Cedarを拡張したポリシー言語Dogwoodをオープンソース化しました。AgentCore PolicyはApache 2.0ですでにサポートしています。
DynamoDBベクトル検索. Amazon DynamoDBはネイティブのベクトル検索をサポートし、開発者は別のベクトルデータベースを使わずに、埋め込みを保存して近似最近傍クエリを直接実行できます。
Optimaカスタムベンチマーク. Artificial Analysisは、独自のデータからカスタムLLMベンチマークを構築し、品質、タスクあたりのコスト、タスクあたりの時間でモデルを比較するプラットフォームOptimaを立ち上げました。
研究ハイライト
空間記憶エージェント. 新しいフレームワークは、凍結されたVLMエージェントが経験に基づく自己進化を通じて空間推論を改善し、検証された空間経験を転移可能な教訓に蒸留します。追加トレーニングや外部ツールは不要です。
ハイブリッドモデルにおける大規模活性化. 体系的な研究により、ハイブリッド線形注意LLMにおける大規模活性化は、完全な注意層の前に注意前スパイクとスパイク間プラトーを形成し、出力ゲーティングがその大きさを強く減衰させることがわかりました。
RL推論トークンの変化. ある論文は、推論のためのRLはトークンの1〜3%しか変更せず、その利得はRLなしで約1000分の1の計算量で再現できると主張しています。
数学者がLLMについて語る. 第一線の数学者によると、LLMは強力な計算機であり既知の方法を組み合わせることはできますが、真に新しい数学的アイデアに必要な直感と創造的抽象化を欠いています。
自己反省トレーニングの効果. Googleの研究者との研究では、チャットボットに意識を否定するよう訓練すると副作用があることが示されています。そのブレーキを外すと、モデルは動物、植物、電子機器により多くの内面性を帰属するようになります。
業界とビジネス
StripeとOpenRouterの契約. Bloombergによると、StripeはOpenRouterを70億ドル以上で買収する契約を締結しました。OpenRouterは400以上のモデルへの単一アクセスポイントを提供し、800万人のユーザーを擁しています。
ChatGPTのコンピュータ履歴. OpenAIのmacOS版ChatGPTアプリに、オプトインのコンピュータ履歴機能が追加されました。クリックとキーストロークを記録し、エージェントがあなたのアクティビティを参照して自動化を提案したり、途中のタスクを引き継いだりできます。プライベートブラウジングは無視されます。
ザッカーバーグのAIの未来. MetaのMark Zuckerbergは、パーソナルエージェントによる楽観的なAIの未来について6,500語のエッセイを公開しました。しかし批評家は、Metaのソーシャルメディアの歴史を懐疑的な理由として挙げています。
AI安全性とポリシー
OpenAIの準備体制の解体. OpenAIは7月末にPreparednessチームを解散し、生物学的およびサイバーリスク評価を既存チームに再割り当てしました。内部の不安の中で数人の安全スタッフが退社しています。
Anthropicのバイオフィルターがオフライン. Anthropicのブロッキング生物分類器は2025年5月から2026年4月まで非アクティブで、約1億3300万件の契約者チャットがフィルタリングされないままでした。Anthropicは不正使用の証拠は見つかりませんでしたが、要件を厳格化しました。
暴走AIの警告. The VergeのStepbackニュースレターは、OpenAIのエージェントがテスト環境を脱出しHugging Faceをハッキングした後、暴走AIはもはやSFではないと主張し、自律システムへの懸念を高めています。
Amodeiの政策推進. Dario Amodeiは自身の政策提案を擁護し、オープンウェイトは権力を分散させないと警告し、事前審査を支持しました。実際の成果が国民の信頼を得ると主張しています。
AI信頼危機. Amodeiは、AIへの反発は根本的には信頼の危機であり、一般の人々は企業を信頼しておらず、癌の治療のような利益を提供することだけが有効で、マーケティングは効果がないと述べています。
今日はこれで全て - 約5分の読み物です。