Phát hành mô hình
Qwen 3.8 27B. Nhóm Qwen của Alibaba đã phát hành Qwen3.8-27B và mô hình lớn hơn Qwen3.8-2.4T-A95B theo Apache 2.0. Mô hình dense 27B dùng chung kiến trúc với Qwen3.6-27B nhưng cải thiện khả năng lập trình, tác vụ văn phòng và lập kế hoạch agent thông qua các thay đổi trong huấn luyện. Nó hỗ trợ ngữ cảnh gốc 262k, có thể mở rộng lên 1M token.
GLM-5.3 từ Zhipu. Zhipu AI phát hành GLM-5.3, sử dụng cùng mô hình nền tảng với GLM-5.2 nhưng mở rộng hậu huấn luyện. Công ty tuyên bố đây là mô hình lập trình mã nguồn mở mạnh nhất, với những cải tiến đáng kể trong lập trình agent và phát hiện lỗ hổng an ninh mạng. Trọng số dự kiến được đưa lên Hugging Face trong hai tuần.
Muse Glimmer của Meta. Meta mã nguồn mở Muse Glimmer, một mô hình agent 30B theo Apache 2.0 nhắm đến các quy trình làm việc cục bộ trên GPU tiêu dùng. Nó chưng cất các kỹ năng suy luận và gọi công cụ từ Muse Spark lớn hơn và từng là mô hình tiên phong trong lớp 30B.
Làn sóng mô hình mã nguồn mở Trung Quốc. Trong chưa đầy một tháng, các phòng thí nghiệm Trung Quốc đã phát hành Kimi K3, Qwen3.8, DeepSeek-V4-Pro-0813 và GLM-5.3, nhấn mạnh sự tiến bộ nhanh chóng của các mô hình mã nguồn mở hàng đầu.
Triển khai cục bộ & Cộng đồng
Tăng tốc trên Apple Silicon. Bản phát hành mlx-dspark mới mang giải mã suy đoán (speculative decoding) đến Qwen3.8-27B trên Apple Silicon, đạt tốc độ sinh khoảng 3× nhanh hơn trên M4 Pro trong khi tạo ra các token đầu ra giống hệt.
Lượng tử hóa và trọng số. Unsloth phát hành trọng số lượng tử hóa của Qwen3.8-27B, và Tim Dettmers đã hé lộ một phương pháp lượng tử hóa mới có thể chạy GLM-5.3 trên một DGX Spark duy nhất với tốc độ 7 token/s.
Các bài kiểm tra đầu tiên về Qwen 3.8. Các bài kiểm tra cộng đồng cho thấy các demo lập trình một lần và hành vi agent mạnh mẽ trong Qwen3.8-27B, nhưng một số người dùng báo cáo kiến thức tổng quát bị cắt giảm đáng kể và chuỗi suy luận rất dài ở mức suy luận xhigh. Các tham số lấy mẫu được khuyến nghị có sẵn trên thẻ mô hình.
- → Qwen 3.8 - 27B is a game changer
- → A hunch: Qwen3.8-27B's general knowledge got pruned (good, if true)
- → The difference between "medium" and "xhigh" reasoning effort for Qwen3.8-27B is actually insane.
- → Qwen 3.8 27B - Aquarium Burst Sample Test
- → RetroCraft - Qwen 3.8 27B Q8, one shot with exact performance data on dual 3090s.
Biến thể cục bộ không kiểm duyệt. Một phiên bản 'heretic' cộng đồng của Qwen3.8-27B loại bỏ các lời từ chối và biện pháp bảo vệ, nhằm cung cấp một giải pháp thay thế cục bộ không kiểm duyệt ở mức mô hình tiên phong như Opus 4.6.
Minh bạch & An toàn AI
Phát hiện watermark của Anthropic. Anthropic sẽ cung cấp một API phát hiện watermark để các nhà phát triển bên thứ ba có thể phát hiện văn bản có khả năng do Claude tạo ra. Phương pháp này sử dụng SynthID Text và kém tin cậy hơn đối với văn bản ngắn, nhiều dữ kiện hoặc được viết lại nhiều.
Google cho phép tùy chọn watermark. Google cho phép người dùng tắt watermark hiển thị trên hình ảnh, video và âm nhạc do AI tạo ra từ Nano Banana, Omni và Lyria. Watermark SynthID vô hình và siêu dữ liệu C2PA vẫn sẽ được nhúng để xác minh.
Chèn lệnh (prompt injection) tại tòa án. Một thẩm phán Connecticut đã ghi nhận một tài liệu tòa án Hoa Kỳ có vẻ là đầu tiên chứa văn bản ẩn nhằm thao túng các hệ thống AI đang xem xét vụ việc. Các hướng dẫn ẩn không có tác dụng, nhưng thẩm phán gọi hành vi này là nguy hiểm.
Tác tử trong sản xuất
Nhiệm vụ bảo trì của Claude Code. Anthropic cho biết Claude Code đã chạy bảo trì hàng ngày trên các ứng dụng của chính mình, tạo 388 pull request với tỷ lệ hợp nhất 46% sau khi xem xét của con người. Các quy trình bao gồm fuzzing sự cố, dọn dẹp các abstraction trùng lặp và kiểm tra phụ thuộc.
OpenAI Computer History. OpenAI Computer History thay thế nguyên mẫu ảnh chụp màn hình Chronicle, ghi lại các cú nhấp chuột, tổ hợp phím và chuyển đổi ứng dụng trên macOS để xây dựng một dòng thời gian tìm kiếm được. Nó có thể phát hiện các quy trình làm việc lặp lại và đề xuất các kỹ năng tái sử dụng cho ChatGPT và Codex.
Ngành công nghiệp & Kinh doanh
Cuộc chiến giá Mỹ-Trung. OpenAI và Anthropic đang cắt giảm giá khi các mô hình mã nguồn mở Trung Quốc chiếm ưu thế; Google Gemini 3.7 Flash ra mắt với mức giảm giá 50% nhằm vào lập trình và agent. Giá token từ các phòng thí nghiệm hàng đầu Hoa Kỳ đã giảm gần một phần tư kể từ giữa tháng 7.
GPT-5.6 Sol Ultrafast. OpenAI đã ra mắt bản xem trước chế độ Ultrafast cho GPT-5.6 Sol hỗ trợ bởi Cerebras, đạt tốc độ lên tới 750 token đầu ra mỗi giây. Dịch vụ API ban đầu chỉ giới hạn cho một số khách hàng chọn lọc và nhắm đến việc phân tích thời gian thực trong các sự cố hoặc sự kiện thị trường.
AI cho mọi người của Meta. Meta ghép việc phát hành Glimmer với một lá thư dài của Zuckerberg lập luận rằng AI nên mở cho tất cả mọi người, nhưng các bài podcast lưu ý rằng công ty vẫn giữ Muse Spark mạnh nhất của mình sau các API. Các cuộc thảo luận tương tự đề cập đến một thương vụ mua lại 250 triệu đô la không thành công.
Mô hình Apple-Alibaba cho Trung Quốc. Theo báo cáo, Apple đã huấn luyện một mô hình AI tùy chỉnh cho thị trường Trung Quốc với sự giúp đỡ của Alibaba, trước khi đưa Apple Intelligence đến các thiết bị Trung Quốc. Quan hệ đối tác này là một sự hợp tác hiếm hoi về AI giữa Mỹ và Trung Quốc.
Nỗ lực suy luận của Kog. Startup Pháp Kog đang sử dụng tối ưu hóa phần mềm để khai thác nhiều tốc độ hơn từ các GPU thông thường như AMD MI300X và Nvidia H200, nhắm đến việc giải mã yêu cầu đơn lẻ nhanh hơn cho các khối lượng công việc kỹ thuật phần mềm.
Rủi ro giá khí đốt tự nhiên. Một dự báo Noreva mới cảnh báo giá khí đốt tự nhiên có thể tăng gấp ba lần ở một số khu vực của Hoa Kỳ khi các nhà siêu quy mô như Amazon, Google, Meta và Microsoft khóa nguồn khí đốt cho các trung tâm dữ liệu AI.
Điểm nhấn nghiên cứu
Mô hình ARC 150M. Một mô hình suy luận tiềm ẩn tái phát (recurrent latent reasoning) 150M tham số đạt 29,5% trên ARC-AGI-1 với chi phí 0,0007 USD mỗi nhiệm vụ, nằm ngoài biên giới chi phí-độ chính xác đã công bố. Nó chạy trên phần cứng tối thiểu, mặc dù việc mở rộng lên hàng tỷ tham số vẫn cần thiết.
Nghi ngờ về nghiên cứu tự động. Một nghiên cứu của Princeton và UK AISI sử dụng các bài báo NeurIPS chưa công bố cho thấy các mô hình hiện đại hiện tại xử lý kỹ thuật nghiên cứu nhưng thất bại ở những phần quan trọng của nghiên cứu, mâu thuẫn với tuyên bố của các phòng thí nghiệm về nghiên cứu AI tự động.
Tiến hóa khung (harness) DarwinX. DarwinX tiến hóa các khung agent thông qua chọn lọc tự nhiên trên các lời nhắc, công cụ, kỹ năng và luồng điều khiển, giữ trọng số mô hình cố định. Nó thêm trung bình khoảng 17 điểm trên bốn điểm chuẩn và chuyển giao không thay đổi sang SWE-bench Verified.
Điểm chuẩn PlayWorld. PlayWorld đánh giá các mô hình thế giới video bằng cách sử dụng các tác tử đa phương thức theo đuổi 171 mục tiêu dài hạn, đo lường tính nhất quán hình học, độ trung thực tương tác, sự tiến hóa ngoài tầm nhìn và sự tiến hóa hiểu biết.
Đó là tất cả cho hôm nay - khoảng 5 phút đọc.