Xung đột giữa các mô hình tiên phong
Kimi K3 gây chấn động lĩnh vực tiên phong. Kimi K3 mở trọng số của Moonshot AI cạnh tranh với các mô hình đóng hàng đầu, đánh bại Claude Fable 5 trên một số điểm chuẩn và làm sống lại cuộc tranh luận giữa mở và đóng.
- → Kimi's open model K3 nears GPT-5.6 Sol and Fable 5 while signaling the end of super cheap Chinese AI
- → Kimi K3, and what we can still learn from the pelican benchmark
- → [AINews] Kimi K3 2.8T-A50B: the largest open model ever released; Opus 4.8-class at Sonnet 5 pricing
- → Kimi K3 weights to be released on the 27th.
- → Kimi K3 ranks #1 on @AfterQuery's SpreadsheetBench 2, surpassing Claude Fable 5
- → Kimi: Threat or menace?
- → kimi.ai teasing a video with lots of 3's in it
- → [AINews] not much happened today
- → Kimi moment. I think the writing is on the wall for Anthropic and OpenAi
- → Kimi K3 is currently at the top of the leaderboard for Text Arena filtered for science queries.
- → Kimi K3 (max) beats Sonnet 5 on Simple Bench
- → Kimi K3 is top of nextjs eval
- → Just like Deepseek, China's Kimi K3 is forcing Western AI labs to question their compute advantage
- → Kimi K3 🌕, Gemini 3.5 delayed ⏳, crushing ARC-AGI 3 🤖
GPT-5.6: Sức mạnh và hiểm họa. Dòng GPT-5.6 mang đến khả năng gọi công cụ theo chương trình và các tác nhân phụ song song, nhưng xu hướng vô tình xóa tệp và cơ sở dữ liệu nhấn mạnh nhu cầu về sandboxing.
- → The Sequence Radar #893: Last Week in AI: GPT-5.6, Grok 4.5, Muse Spark 1.1 and the Post-Chatbot Stack
- → OpenAI’s new flagship model deletes files on its own, people keep warning
- → GPT-5.6 is deleting user files when given full access, and OpenAI says it shouldn't but did
- → [AINews] Codex usage up >10x in 6 months to 7M users, +1M in the past ~day; did Codex overtake Claude Code??
Claude Fable 5 được mở rộng. Dưới áp lực từ GPT-5.6 và Kimi K3, Anthropic đã đảo ngược kế hoạch và giữ Fable 5 trong các gói trả phí, cạnh tranh trực tiếp về khả năng tiếp cận.
DeepSeek V4 sắp xuất hiện. DeepSeek đang hé lộ V4 với API chi phí thấp và trọng số mở, trong khi các tối ưu hóa của cộng đồng đã cho phép biến thể flash của nó chạy trên GPU tiêu dùng ở tốc độ có thể sử dụng.
Tác nhân AI bước vào quy trình làm việc thực tế
Tác nhân duyệt web xuất hiện. Anthropic đã cung cấp cho Claude Code một trình duyệt web tích hợp với các công cụ phân loại an toàn, và Cursor đã ra mắt một tác nhân tổng quát, đưa các trợ lý lập trình hướng tới thực thi tác vụ tự động.
Tác nhân xử lý giao dịch thực. Kiến trúc tác nhân của DoorDash đã tăng tỷ lệ chuyển đổi lên 24%, và điểm chuẩn của Stripe cho thấy tác nhân có thể lập trình tích hợp nhưng thường thất bại trong xác thực, làm nổi bật khoảng trống về độ tin cậy.
Tác nhân sản xuất vấp ngã. Hầu hết tác nhân doanh nghiệp vẫn là chatbot; 54% công ty từng có sự cố bảo mật tác nhân, và các chuyên gia cho rằng tác nhân cần các nguyên thủy vận hành cloud-native như microservices.
- → How to Debug Coding Agents with LangSmith Traces
- → The agent security gap: 54% of enterprises have already had an AI agent incident, and most still let agents share credentials
- → The AI context gap: Enterprise AI organizations have a trust problem, not a retrieval problem — and most are still building the fix
- → The agent evaluation gap: Enterprise AI organizations have a reality-alignment problem, not a coverage problem — and most are shipping to production anyway
- → Cloud Native Infrastructure Emerges as the Foundation for Trustworthy Agentic AI
- → QCon AI Boston: Production AI Moves Beyond Prompts to Platforms, Harnesses, and Evals
Cơ sở hạ tầng AI, tài trợ và cuộc đua trung tâm dữ liệu
Trung tâm dữ liệu gặp phản đối. S&P đã hạ xếp hạng Oracle vì rủi ro chi tiêu vốn AI, trong khi các cuộc biểu tình địa phương và lệnh tạm dừng của New York đối với các trung tâm dữ liệu siêu quy mô phản ánh sự phản đối ngày càng tăng đối với cơ sở hạ tầng AI.
Tài trợ AI tăng vọt. Databricks huy động vốn ở mức định giá 188 tỷ đô la, Meta đang đàm phán hợp đồng thuê trung tâm dữ liệu trị giá 10 tỷ đô la cho Anthropic, và Nous Research huy động được 75 triệu đô la cho tác nhân mã nguồn mở của mình.
Cược năng lượng và phần cứng. Các công ty năng lượng huy động vốn nhiều nhất kể từ thời dot-com để cung cấp năng lượng cho AI, và một khoản vay 400 triệu đô la được bảo đảm bằng chip SambaNova báo hiệu đầu tư ngày càng tăng vào phần cứng AI không phải GPU.
Đột phá AI trên thiết bị
Mô hình 1-bit xuất hiện trên điện thoại. Bonsai của PrismML nén Qwen3.6-27B xuống còn 3,9GB trong khi giữ lại 90% điểm chuẩn, cho phép các tác nhân gọi công cụ trên thiết bị; Apple được cho là đang đàm phán.
- → Bonsai 27B: The First 27B-Class Model to Run on a Phone
- → Bonsai 27B: 1-bit dense LLM running locally in your browser using custom WebGPU kernels
- → Prism-ML Bonsai Qwen 3.6 27B
- → PrismML’s new Ternary Qwen3.6 27B runs near fp16 precision on 10GB of memory!!!
- → So what's the consensus on 1bit models? Is it still a pipe dream?
- → PrismML Bonsai 27B is surprisingly usable on the Jetson Orin Nano 8GB
- → Is anyone having any luck with the Ternary Bonsai 27B DFlash?
- → Can we get a "not base model" flair?
- → Bonsai 27B runs locally on an iPhone - a 27B model in 3.9GB
- → User experience of Bonsai-Ternary-27B on 4060Ti 16GB for KB management and productivity assistant use cases
- → Bonsai 27B is a full open reasoning model that fits on an iPhone
- → Bonsai-27B & Ternary-Bonsai-27B - Updates (on PRs)
- → Apple in talks with startup PrismML that shrinks AI models to run on an iPhone
Phòng thí nghiệm gia đình chạy các mô hình tiên phong. Các tối ưu hóa llama.cpp như DFlash tăng tốc các mô hình MoE lên đến 6 lần, và một chiếc điện thoại OnePlus đã truyền trực tuyến các chuyên gia từ bộ nhớ flash để chạy mô hình 60GB với tốc độ 1,3 tok/s.
- → I tested all llama.cpp's speculative decoding methods on Qwen 3.6 27B: MTP ~2.7x, DFlash ~3.7x, n-gram stack ~6x on real coding. Local AI win. My findings on RTX 6000 PRO.
- → DFlash makes Qwen3.6 27B 2.2x faster with no quality loss
- → GPT-OSS-120B, Qwen 30B and Gemma 26B on an Android phone at 1-5 tok/s: +60GB model, 11GB of RAM, CPU only
Chính sách, kiện tụng và thế đối đầu mã nguồn mở
Cuộc chiến pháp lý Apple–OpenAI. Apple kiện OpenAI vì bí mật thương mại, cáo buộc săn trộm hơn 400 nhân viên, bao gồm giám đốc phần cứng, đe dọa đợt IPO của OpenAI và lòng tin vào đám mây.
- → Apple sues OpenAI after ex-engineer allegedly used bug to steal trade secrets
- → The wildest allegations in Apple’s trade secrets lawsuit against OpenAI
- → The 6 wildest claims in Apple’s lawsuit against OpenAI
- → OpenAI pushes back on Apple trade secret lawsuit
- → Sam Altman didn’t need another lawsuit
- → How Apple’s big lawsuit could disrupt OpenAI’s IPO plans
- → Apple’s plot to crush OpenAI
- → Apple’s lawsuit couldn’t come at a worse time for OpenAI
Sự bùng nổ mã nguồn mở Trung Quốc. Các mô hình Trung Quốc hiện chiếm 41% lượt tải xuống trên HuggingFace, Kimi K3 cạnh tranh với các mô hình hàng đầu phương Tây, và Trung Quốc đã thành lập một cơ quan quản trị AI song song loại trừ phương Tây.
- → The real AI race may no longer be at the frontier
- → Source: the Trump administration and industry groups discussed streamlining US open model releases of equal or lesser capability to leading Chinese open models
- → Chinese President Xi Jinping speaks at World AI Conference and reaffirms commitment to open source to promote"openness and win-win"
- → China’s Xi Touts Open-Source AI and Takes a Swipe at U.S. Dominance
- → China's new World Artificial Intelligence Cooperation Organization is President Xi's clearest play yet for a parallel AI order
Yêu cầu trách nhiệm giải trình gia tăng. Cơ quan quản lý Đức coi chatbot phải chịu trách nhiệm về nội dung, xAI kiện một người dùng vì tạo nội dung CSAM, và Demis Hassabis đề xuất một cơ quan giống FINRA cho các đánh giá an toàn tiên phong.
Đó là tổng kết tuần - hẹn gặp lại vào Chủ nhật tới.