Phát hành Agent & Mô hình
Tencent Hy4 bản preview. Tencent đã phát hành bản Hy4 preview, có kích thước lớn hơn hẳn Hy3, với high reasoning mặc định và chế độ no_think. Cộng đồng đã có bản quant chính thức ~2,38-bit và file GGUF ~200GB, được cho là giữ khoảng 98% hiệu năng BF16.
Inference cục bộ & Phần cứng
FlashMLA bản sm_120. Một bản build từ cộng đồng mở rộng FlashMLA lên GPU Blackwell sm_120 tiêu dùng, cho thấy tốc độ nhanh gấp 2–3 lần PyTorch SDPA trong một số tác vụ sparse MLA và độ trễ giải mã FP8 KV cache thấp hơn 8%.
Nemotron 16GB bản vá. Các file GGUF low-bit của Nemotron-3.5-Lightning thực chất nằm ở mức ~4,70 bpw do lượng tử hóa theo chiều rộng hàng; một bản llama.cpp đã vá tạo ra file 3,07 bpw / 11,77 GiB thực sự, chạy context 262K trên 16GB.
Qwen3.8-Flash-Next trên Mac. Một bản Qwen3.8-Flash-Next 2-bit nặng 79GB đã chạy trên M5 Max 128GB với slot context 350K bằng llama.cpp, bao gồm prefill nguội 333 giây cho prompt 105K và speculative decoding ngram-mod.
DeepSeek V4 Flash trên 2 GPU. Trên các thiết lập 2x DGX Spark/GX10, DeepSeek V4 Flash 0731 đạt 67–84 tok/s ổn định, với HumanEval Pass@1 cục bộ là 94,5% so với 97,0% của GLM-5.3-Flash NVFP4. GLM chỉ mất khoảng một nửa thời gian để hoàn thành benchmark.
Context 1M trên 2 GPU 5090. Một bản fork NInfer bổ sung tensor parallelism và mở rộng YaRN ×4 để chạy Qwen3.8-27B NVFP4 với context 1.048.576 token trên hai GPU 5090, giải mã ở 48–100 tok/s tại 1M và duy trì tỷ lệ chấp nhận MTP trong khi vLLM tụt về 0.
27B trên 16GB. Lượng tử hóa hybrid kết hợp cài đặt kvarn cache giúp Qwen3.8-27B chạy với context 100K ở 50 tok/s trên RTX 4070 Ti SUPER 16GB, sử dụng MTP speculative decoding và KV cache tail-precision.
FreeToken engine MoE. Các nhà nghiên cứu từ UC Berkeley và MIT giới thiệu FreeToken, một engine mã nguồn mở phối hợp lập lịch linh hoạt việc truyền expert MoE để các mô hình sparse hàng đầu có thể giải mã trên GPU tiêu dùng mà không bị chững lại vì các miss PCIe/RAM.
Benchmark & Đánh giá
Terminal Bench 4.0. Terminal Bench 4.0 được phát hành với bảng xếp hạng mới và tập trung vào vòng lặp nhanh để chống bão hòa; GLM-5.3 đạt điểm ở mức Fable 5 trong mức sai số cho phép.
Công bố benchmark tài chính. Một benchmark card cho Ling-3.0-flash-Fin cho thấy phần scaffolding của agent, các công cụ và pipeline đánh giá ảnh hưởng đến kết quả công bố như thế nào; nhiều lần chạy dùng ReAct với tìm kiếm web và Python, và một số bộ eval là nội bộ hoặc chưa công khai.
Nghiên cứu & Hạ tầng Agent
Bộ nhớ WikiSkill của Google. WikiSkill của Google Research cung cấp cho agent một cơ sở tri thức lâu dài kiểu wiki về các lần thất bại và thành công trong quá khứ, đóng gói các Agent Skills có thể tái sử dụng để định hướng hành vi mà không thay đổi trọng số mô hình.
Model Hardware Standard của Anthropic. Anthropic đang xây dựng MHS, một giao diện thống nhất cho phép agent điều khiển các thiết bị vật lý như kính hiển vi và cánh tay robot; các thử nghiệm ban đầu đã rút ngắn thời gian tích hợp đa máy từ vài tuần xuống vài giờ, nhưng vẫn cần có sự giám sát của con người.
Tầng dữ liệu cho agent. Một bài trình bày của TOTVS lập luận rằng các hệ thống giao dịch và data lake không được tối ưu cho khả năng suy luận của agent vốn ngốn token và nhạy cảm với độ trễ, đồng thời mô tả việc phát triển truy cập dữ liệu theo hướng MCP và các mô hình ngữ nghĩa.
Big Video Dataset của LAION. LAION phát hành BVD, một dataset chỉ dành cho nghiên cứu với 10 triệu giờ video, 55 triệu clip và 300 triệu ảnh tĩnh, liên kết video, âm thanh và văn bản; các mô hình huấn luyện trên đó vượt baseline InternVid tới 2,1 điểm ở một số benchmark.
Ngành & Kinh doanh
Sony và Warner kiện Anthropic. Sony Music Publishing, Warner Chappell và các nhà xuất bản khác đã kiện Anthropic, cáo buộc hãng này dùng torrent và scraping các tác phẩm có bản quyền để huấn luyện Claude, đồng thời yêu cầu bồi thường tới 150.000 USD mỗi tác phẩm. Anthropic cho biết sẽ tự bảo vệ.
OpenAI cắt hợp đồng với Cursor. OpenAI đang chấm dứt hợp đồng với Cursor sau khi SpaceX mua lại Cursor, viện dẫn lịch sử phá hợp đồng của các công ty Elon Musk. Anthropic phản hồi bằng cách định vị mình là đối tác đáng tin cậy hơn và cam kết tiếp tục cung cấp compute cho việc Cursor dùng Claude.
Nvidia vượt ra ngoài GPU. Câu chuyện kết quả kinh doanh của Nvidia đang dịch chuyển từ thị phần GPU sang điều phối trung tâm dữ liệu và các hệ thống xung quanh GPU, nơi hãng đã xây dựng phần cứng mạng và điều phối hiện đại bậc nhất khi điện toán AI mở rộng tới quy mô gigawatt.
Đó là tất cả cho hôm nay - khoảng 5 phút đọc.