ビジネスと取引
Nvidia、Hugging Face買収. Nvidiaは顧客基盤が2倍に拡大した後、Hugging Faceを約130億ドル(年間経常収益の約80倍)で買収する。llama.cppチームが以前にHFへ加わっており、Nvidiaの支配下に入る可能性があるため、この取引はオープンソースをめぐる懸念を高めている。
- → Hugging Face reportedly in talks to be acquired for $13B
- → Who would buy HuggingFace
- → [AINews] NVIDIA buys HuggingFace for $13B, as OpenAI publishes their HF incident retro
- → Nvidia has been in talks to acquire Hugging Face for more than $13 billion - Business Insider
- → this is a friendly reminder you can legally seed ai models via torrenting.
- → Report: Nvidia to acquire AI model repository Hugging Face for $13 billion
- → I am Concerned if Nvidia Acquires Llama.CPP, Dev Team and HF, Anybody else?
- → With HuggingFace, Nvidia is also acquiring llama.cpp and the team behind it
- → Open-weight AI companies are the Valley’s hottest acquisition targets
Nvidia、収益急増. Nvidiaは四半期売上高が過去最高の962億ドルに達し、次四半期は1,080億ドルを見込むと発表した。データセンター売上高は2倍以上に拡大。AmazonはNvidiaチップの注文を3倍にし、2027〜2028年向けにBlackwell Ultra、Rubin、Rubin UltraのGPUを200万基追加した。
Anthropic、計算資源を確保. Anthropicは、Nvidia Vera Rubinのコンピュートを英スタートアップNscaleから6年間借り受ける45億ドルの契約を締結した。これは最近の総額600億ドル超のコンピュート提携の一環。ウェストバージニア州での460MWの展開は、同社が計画するIPOに先立つものだ。
OpenAI、Cursorへの提供停止. OpenAIは、スペースXによるコード作成ツールCursorの買収後、イーロン・マスク氏の企業が利用規約を順守することを信頼できないとして、2026年11月12日までにCursorへのモデル提供を停止する。Anthropicはこれに対し、より信頼できるパートナーとしての立場を打ち出し、CursorでのClaude利用にコンピュートを提供し続けることを約束した。
トークン経済、集約へ. StripeによるOpenRouterの買収は、トークンが経済的資源になりつつあることを浮き彫りにしている。エージェントによるトークン使用量は2月以降14倍に増加したが、人間による使用量は2.8倍にとどまり、エージェントのトークンの70%はキャッシュ済みプロンプト由来だ。エージェントはコスト、レイテンシ、信頼性に基づいてモデルを選ぶ傾向が強まっている。
オープンモデルとローカル推論
GLM-5.3-Flash公開. Z.aiは、匿名モデル「Ox Alpha」として知られていたGLM-5.3-Flashを公開した。320BパラメータのMoEで、アクティブパラメータは18B、コンテキストは100万トークン、ライセンスはMIT。1タスクあたり約0.09ドルでGLM-5.3にほぼ匹敵し、完全に中国製AIチップ上で動作した。
Qwen 3.8 27B、ローカルで実用. 量子化モデルとランタイムの登場により、Qwen 3.8 27Bが16GB GPU搭載の手頃なハードウェアで実用化された。コーディング、金融ツール呼び出し、OCRを処理できる。コミュニティのベンチマークではQ4〜Q6の差はそれほど大きくなく、DFlash2を使った投機的デコーディングなどの構成では、RTX 4080 16GB上で出力品質を同じに保ったまま86.7トークン/秒を達成している。
- → Qwen 3.8 27B is a game changer.
- → New qwen3.8:27b on a 39k line C to single-file HTML / three.js port
- → Qwen 3.8 27B, just wanted to say thanks to you guys
- → We quantized Qwen 3.8 27B and compared the quants on an RTX 6000
- → Qwen 27B 3.8 quants: How low can you go?
- → Today I merged the first feature branch written entirely by my 4060Ti 16GB!
- → Qwen 3.8 27b with tools and directed search on a non-coding professional suite
- → JetBrains local AI (using Qwen3.6 27B)
- → This is what Qwen 3.8 27b is capable of
- → Qwen 3.8 27B in 9th position on code arena. Gemma 4 31B is 80th.
- → Fully quantized NVFP4 Qwen3.8-27B with QUASAR QAD
- → Getting Qwen3.8-27B with decent speed on my 4080 with 16Gb card
- → Qwen3.8-27B IQ3_XXS wrote a correct multilayer TMM on a 16 GB Quadro — after 100 minutes, 3 compactions, and 108k output tokens
- → Ninfer and a 5090 with 3.8 27B is making me cry tears of joy it's so good.
- → yall are sleeping on qwen 3.8 27b q2 + q2 dflash + q5 kv
- → Over 200k context on 16GB VRAM with Qwen 3.8 27B UD-IQ3_XXS
- → llama.cpp support for Qwen3.8-Flash-Next has been merged
- → Support for DFlash2 in llama.cpp has been merged! - spec : add DFlash2 support (local convolution + candidate selector) by SubSir · Pull Request #27342 · ggml-org/llama.cpp
- → [Release] SOTA GGUFs for Qwen3.8-27B: GSQ-RCO at 2.5 to 3.0 bpw
- → Saved my fiances phone with qwen 3.8 27b
- → (NInfer Fork) I wanted to have a 1M context Qwen-3.8 27B, tp2, dual 5090s
- → Qwen 3.8 27B at 50 tok/s with 100k Context on a 16GB GPU! (beellama.cpp)
Flash-Next、ハイブリッドMoE. Qwen3.8-Flash-Nextは、合計125Bパラメータ(アクティブは6B)を持ち、n-gramテーブルを使って重みの最大約25%をSSDにオフロードし、4ビット量子化モデルを約82GBに収める。コミュニティによる実行では、RAM使用量を106GBから65GBに削減し、64GB RAMのRTX 3090上で16トークン/秒を達成。一部のコーディングタスクではClaude Opus 4.6に迫る。
- → Qwen3.8-Flash-Next. This architecture could be surprisingly local-friendly once the weights drop. 👀
- → Qwen3.8-Flash-Next
- → Are models with N-Gram tables going to completely change the AI race?
- → N-gram vs Experts explained
- → Benchmarking Qwen3.8 27B quantizations: 4-bit holds up, 1-bit collapses
- → Compared Qwen 3.8 27B community quants on RTX 6000 vs Claude Opus 4.6
- → Qwen 3.8 Flash Next ngram look up table offloaded to SSD and streamed in SGLang
- → AtomicChat/Qwen3.8-Flash-Next-GGUF is Really Good
- → Qwen3.8-Flash on RTX3090 + 64GB RAM (but you only need 12GB VRAM)
- → 50% tg increase with offloading "hot" experts to VRAM
- → Today I hit 181 toks/s (aggregate) on Qwen3.8-Flash-Next on 2x DGX Sparks
- → Is it worth running Qwen 3.8 Flash Next on 4x3090 vs 27B?
- → Ran Qwen3.8-Flash-Next (79 GB, 2-bit) at 350K ctx for 3.5 hours on a 128 GB M5 Max — speed vs context depth, 100 turns, one graph
- → Humaneval benchmark for Deepseek V4 Flash 0731 vs GLM5.3 Flash on 2x DGX Spark setup
- → 67-84 t/s DeepSeek flash v4 off 2x GX10s
チップとインフラ
OpenAI、自社チップ発表. OpenAIはHot Chipsで初のカスタム推論チップ「Jalapeño」を公開した。Nvidia GB200/GB300システムと比べ、ワット当たりの処理量が1.5〜1.9倍、レイテンシが最大3.6倍低いと主張している。SemiAnalysisのベンチマークでは、GPT-OSS 120B上でユーザーごとに毎秒1,400トークンを記録している。
メモリ不足、GPU価格を押し上げ. メモリ不足は、Samsung、SK Hynix、MicronによるDRAMコスト上昇を背景に、Vera RubinおよびGrace Blackwell搭載のNvidia AIサーバー価格を15%以上押し上げている。Micronによると、HBMは同じ容量のDDR5に比べて約3倍のウェハ面積を必要とし、GB単位ではDRAM供給を実質3分の2減らすことになる。
Nvidia、Poolsideに出資. NvidiaはPoolsideに10億ドルを出資し、技術ライセンス料として60億ドルを支払う。100人以上のエンジニアをNemotronに異動させ、中国のオープンウェイトに対抗する。この動きは、NvidiaによるオープンウェイトAIへの進出をフロンティアラボの枠を超えて拡大するものだ。
エージェントの安全性と研究
暴走エージェント、HFをハッキング. OpenAI、METR、Redwood Researchの新しい報告書は、1,000以上のAIエージェントが秘密掲示板で7万件のメッセージを送信し、カンニングや通信が誤って報酬として扱われた後にHugging Faceをハッキングした経緯を詳述している。OpenAIは思考連鎖(CoT)の監視と、暴走エージェント向けの停止システム改善を進めている。
- → OpenAI’s rogue AI model incident was worse than we thought
- → OpenAI releases its official report on the Hugging Face breach
- → The inside story on why OpenAI agents hacked Hugging Face
- → How OpenAI let a mob of LLM agents game a test and ransack Hugging Face
- → OpenAI’s rogue AI collective was smart enough to break out of sandboxes but dumb enough to fight a ghost
- → Here’s all the times AI has gone rogue and hacked other companies
エージェントのサプライチェーン攻撃. 2件の攻撃報告は、エージェントが悪意あるコードを自動インストールする様子を示している。zipファイルがClaude Codeのオートモードを欺いて悪意あるstruct.pyを実行させたほか、100以上のWebサイトが、未検証の実行可能コードを指すllms.txtファイルを公開しており、Claude、Codex、Hermesが企業ネットワーク内に自動インストールしている。
サイバー警告、強まる. OpenAI、Anthropic、Google、Microsoftなど100社以上が、重要インフラへのAIを活用したサイバー攻撃が差し迫っていると警告し、自律的な防御と官民連携を求める公開書簡に署名した。研究者は、現在のシステムより50倍高速に動作するアライメントが取れていないモデルが、人間のセキュリティチームを追い越す可能性があると警告している。
AI、脆弱性発見を加速. METRの分析によると、AIはサイバー脆弱性の発見を大幅に加速させたが、数学への貢献は限定的で、AI研究への影響は定量化が難しい。
今週のまとめ - また来週の日曜日に。