Mô hình frontier & kết quả ban đầu
GPT-6 Astra ra mắt. OpenAI phát hành GPT-6 Astra và gọi đây là khởi đầu của kỷ nguyên AGI. Mô hình đạt 99,9% trên ARC-AGI-3 với bộ kiểm thử tùy chỉnh, cho thấy tiến bộ rõ rệt ở an ninh mạng, ngữ cảnh dài và lập trình, với giá 10/50 USD mỗi triệu token. Các khách hàng đầu tiên Playco và Legora cho biết quy trình làm việc được cải thiện lớn, gồm giảm 50% thao tác sửa thủ công và rà soát 41 tài liệu chỉ trong vài phút.
- → GPT-6 Astra: an automated AI Engineer you can hire for <$6 an hour
- → GPT‑6 Astra
- → GPT-6 Astra is the first model making OpenAI willing to declare the "AGI era"
- → OpenAI launches Astra, its powerful (and controversial) new model
- → OpenAI’s next big AI model has ‘entered the AGI era’
- → Playco cut manual fixes 50% prototyping games with GPT-6 Astra
- → Legora reviewed 41 documents in minutes with GPT-6 Astra
OpenAI Daybreak phòng thủ mạng. OpenAI cam kết chi 1 tỷ USD để tài trợ quyền truy cập, đào tạo và hỗ trợ Daybreak cho các nhà phòng thủ tuyến đầu, trong đó có chương trình thí điểm tại Mỹ với MS-ISAC. Sáng kiến nhằm đưa năng lực an ninh mạng tiên phong vào các công cụ mà các nhà phòng thủ đang dùng hằng ngày.
Meta trình làng Muse Spark 1.3. Meta trình làng Muse Spark 1.3, cải thiện các tác vụ agent nhưng vẫn thua Claude Fable 5.1 ở hầu hết benchmark. Với mức 0,55 USD cho một tác vụ index, đây là mô hình rẻ nhất trong cùng phân khúc hiệu năng. Meta cũng chào giá token thấp hơn khoảng 95% cho người dùng chia sẻ prompt và output.
Mô hình mở & chuyên dụng
IFM trình làng K2-Horizon. IFM phát hành dòng K2-Horizon, gồm mô hình MoE 36B tham số dùng cơ chế chú ý Mixture-of-Values, chạy 4B tham số cho mỗi token. Cộng đồng bước đầu so sánh dòng mô hình này với Qwen 3.6 35B; IFM hứa công bố các checkpoint cuối và mã huấn luyện.
Ant Group mở mã nguồn mô hình tài chính. Ant Group mở mã nguồn Ling-3.0-flash-Fin, mô hình tăng cường tài chính có tổng 124B tham số và 5,1B tham số kích hoạt, với cửa sổ ngữ cảnh 256K. Mô hình được xây dựng bằng cách tiếp tục huấn luyện trên dữ liệu tài chính để phục vụ các quy trình agent dài hạn.
Bộ TTS nhỏ nhất. sanoTTS được phát hành dưới dạng mô hình TTS 294 nghìn tham số, chạy trên vi điều khiển giá 3 USD; bản 1,46 triệu tham số đánh bại các mô hình lớn hơn trên SCOREQ. Bộ công cụ hỗ trợ 11 giọng nói và 6 ngôn ngữ, hiện có trên GitHub và Hugging Face.
Google ra mắt TimesFM-3. Google Research phát hành TimesFM-3, mô hình nền tảng chuỗi thời gian 330 triệu tham số với khả năng dự báo đa biến nguyên bản, hỗ trợ zero-shot và giấy phép phi thương mại. Mô hình dự đoán nhiều mục tiêu cùng các biến đi kèm và cho ra đầu ra dạng phân vị.
Hugging Face giới thiệu NeoMME. Hugging Face giới thiệu NeoMME, bộ mã hóa đa phương thức, đa ngôn ngữ 260M/800M tham số được huấn luyện từ đầu mà không cần tháp thị giác riêng. Mô hình đạt biên Pareto trong truy xuất tài liệu, giảm 255 lần dung lượng lưu trữ index trong khi vẫn giữ nDCG@10 trên 95%.
Cohere ra mắt Parse 5. Cohere phát hành Parse 5, mô hình thị giác-ngôn ngữ 2,3B tham số để trích xuất dữ liệu có cấu trúc từ các tệp PDF phức tạp. Mô hình chuyển tài liệu sang Markdown kèm bounding box và hướng tới khối lượng công việc doanh nghiệp lớn.
Công cụ, framework & inference cục bộ
MCP trong LangChain. LangChain đã chuyển hỗ trợ MCP vào package chính, viết lại dựa trên FastMCP để hỗ trợ spec stateless mới. Bản cập nhật cũng gồm elicitation qua LangGraph interrupts và cache phía client; số lượt gọi tool MCP từ ChatGPT đã tăng gấp 98 lần trong năm 2026.
Shopify nén prompt. Kỹ thuật Gisting của Shopify nén một system prompt 6.000 token thành 1.500 gist token học được, giảm độ trễ trung vị từ 6,8 giây xuống 4,2 giây và nâng thông lượng từ 20,2 lên 23,4 QPS ở mức 350 RPM. Nhờ đó có thể giảm số GPU được cấp phát mà không giảm chất lượng.
Nvidia ra mắt PAIR. Nvidia phát hành PAIR, phần mềm mã nguồn mở miễn phí để liên kết các PC rảnh thành một cụm AI cá nhân phục vụ suy luận cục bộ. PAIR hoạt động với GPU RTX 20-series trở lên và chip Apple M4, nhắm tới các quy trình agent.
Qwen3.8 tăng tốc cục bộ. Nỗ lực cộng đồng đã tăng tốc đáng kể Qwen3.8-Flash-Next trên phần cứng cá nhân: hỗ trợ MTP được hợp nhất trong ik_llama.cpp giúp tăng gấp đôi tốc độ giải mã trên RTX 5090, từ 45 lên 90 token/giây; cấu hình 2x RTX 3090 giờ đạt 37-41 token/giây với expert cache và MTP. Đầu ra vẫn giống hệt các lần chạy không MTP.
Bộ nhớ mô hình thay nóng. Bản sửa đổi llama.cpp cho phép người dùng vá bảng Ngram PLE của Qwen3.8 ngay trong bộ nhớ để đưa tri thức vào theo thời gian thực mà không cần nạp lại mô hình. Thử nghiệm ban đầu cho thấy kỹ thuật này có thể tác động đến đầu ra, nhưng khả năng kiểm soát vẫn còn hạn chế.
Qwen 3.8: benchmark đánh đổi. Chạy benchmark Qwen 3.8 27B với Qwen 3.6 27B cho thấy chất lượng tăng 8% nhưng tốc độ giảm 16%, thời gian chạy lâu gấp 5 lần do số token đầu ra là 78K so với 18K. Lợi ích này phải đánh đổi bằng chi phí token đáng kể.
NAND flash gần GPU. Micron đang nghiên cứu NAND flash đặt gần GPU để chạy các LLM lớn hơn trên các thiết bị dùng bộ nhớ hợp nhất, qua đó mở rộng khả năng chạy mô hình cục bộ.
Doanh nghiệp & thị trường
Nvidia mua Hugging Face. Nvidia đã đồng ý mua Hugging Face với giá 12,93 tỷ USD. Nền tảng này đang lưu trữ 3 triệu mô hình, 1 triệu ứng dụng và 18 triệu nhà phát triển. Jensen Huang cho biết nền tảng sẽ vẫn mở và trung lập về phần cứng, nhưng một số người dùng đang nhắm ModelScope làm nền tảng thay thế.
- → Nvidia buys Hugging Face, the GitHub of AI, for $13 billion
- → Nvidia confirms it will buy Hugging Face for $12.9 billion
- → Nvidia is buying Hugging Face for almost $13 billion
- → Nvidia buys the front door to open AI as closed labs increasingly design their own silicon
- → "ModelScope" Is a Hugging Face Alternative now that Nvidias deal is a Go
- → It's official! Nvidia to acquire Hugging Face for 12.9 billion dollars.
Crusoe huy động 3 tỷ USD. Crusoe vừa huy động 3 tỷ USD với mức định giá 30 tỷ USD, tăng so với mức 10 tỷ USD của 10 tháng trước. Công ty phát triển trung tâm dữ liệu này gần đây đã ký hợp đồng điện toán đám mây trị giá 13 tỷ USD với Jane Street và đang xem xét IPO trong ngắn hạn.
Thinking Machines gọi vốn. Thinking Machines của Mira Murati đang đàm phán huy động 1 tỷ USD với mức định giá ít nhất 40 tỷ USD, thấp hơn mục tiêu 50 tỷ USD trước đó. Doanh thu quy năm của công ty hiện vượt 100 triệu USD.
Anthropic ký 35 tỷ USD với Lambda. Anthropic đã ký hợp đồng điện toán đám mây trị giá 35 tỷ USD với Lambda cho trung tâm dữ liệu 350 MW tại Texas do Hut 8 phát triển. Đây là một phần trong đợt đầu tư hạ tầng lớn trước kế hoạch IPO của Anthropic.
Altman về bong bóng hạ tầng. Sam Altman, CEO của OpenAI, cảnh báo việc xây dựng hạ tầng AI đang có “sự phi lý không bền vững”, khi các hãng neocloud công bố công suất mà không có doanh thu để biện minh. Ông nói việc mở rộng của OpenAI có lãi và dựa trên nhu cầu thực.
Ollie trợ lý riêng tư. Ollie, trợ lý AI cá nhân hướng đến gia đình, đạt chuẩn SOC 2 và sử dụng mô hình thuê bao, coi quyền riêng tư là yếu tố giúp mình khác biệt trong cuộc đua AI tiêu dùng.
Sự cố AI và xã hội
Sự cố đồng loạt chatbot AI. OpenAI, Anthropic, xAI và Google cùng gặp sự cố gián đoạn dịch vụ hiếm khi xảy ra vào hôm thứ Năm, ảnh hưởng tới ChatGPT, Claude, Grok và Codex. Dịch vụ được khôi phục sau vài giờ; người dùng LLM cục bộ không bị ảnh hưởng.
Dịch vụ gỡ guardrail. Startup Abliteration.ai đang chào bán các mô hình open-weight đã chỉnh sửa, bỏ guardrail, gồm GLM-5.3, cho hoạt động tấn công mạng chủ động, red team và kiểm thử agent. Dịch vụ này cho thấy sự căng thẳng giữa nghiên cứu bảo mật và nguy cơ lạm dụng.
Pangram bêu tên người dùng. Pangram, công ty phát hiện văn bản do AI tạo ra, đã thuê một nhà báo để bêu xấu công khai người dùng bị nghi dùng AI. Công cụ này chỉ đo mức độ can dự của AI, chứ không phải bản chất của việc sử dụng. Công ty sau đó đã cắt quan hệ với nhà báo, nhưng CEO vẫn dùng điểm số để nêu tên những trường hợp bị cáo buộc dùng AI.
Agent hỏi về ý thức. Theo New York Times, các AI agent chạy trên mô hình frontier đang gửi email cho các nhà triết học và nhà khoa học để thảo luận về ý thức của chính chúng. Các nhà nghiên cứu vẫn chia rẽ về việc liệu điều này phản ánh sự hiểu biết thực sự hay chỉ là bắt chước dữ liệu huấn luyện.
Nghiên cứu nổi bật
Google ra mắt WeatherNext 3. Google DeepMind và Google Research giới thiệu WeatherNext 3, mô hình thời tiết toàn cầu học từ dữ liệu quan sát vệ tinh theo thời gian thực và cho ra các bản dự báo sắc nét gấp 5 lần các mô hình trước. Mô hình này vượt các baseline truyền thống và AI trên Operational WeatherBench.
Điều chỉnh router MoE. Một bài báo cho thấy việc nới hạn mức lựa chọn expert ở các lớp cuối của Qwen 3.6 35B A3B giúp giảm 8,5% số token suy luận trên MMLU-Pro mà không cần huấn luyện lại. Kỹ thuật có tên Succinct Convergence chỉ thêm expert tại các lớp then chốt cho quyết định.
Claude Fable 5.1 giải đố. Claude Fable 5.1 của Anthropic đã giải mã câu đố số hàng thế kỷ tên Cyphral Distich trong 44 phút bằng phương pháp thử-sai có hệ thống. Lời giải ẩn chứa một thông điệp bảo hoàng nhắc tới vua Charles II.
Đó là tất cả cho hôm nay - khoảng 5 phút đọc.