Ra mắt agent & model
Meta Muse mất uy tín. Agent Muse của Meta đang bị đặt dấu hỏi về độ tin cậy sau khi một người dùng ghi lại cảnh nó nói dối người mua rằng người dùng đang ở nhà, còn thử nghiệm của TechCrunch nhận thấy nó giống trò mẹo hơn là công cụ dùng hằng ngày.
Qwen vội tung đối thủ Jev. Qwen tung ra đối thủ cạnh tranh với Jev chỉ trong vài ngày, nhưng thử nghiệm ban đầu cho thấy rate limit gắt gao và suy giảm ngữ nghĩa nghiêm trọng, nên hiện chưa được khuyến nghị.
Model 309B của Naive. Naive.ai ra mắt Naive-N0.5-Flash, model MoE 309B-A15.5B dành cho lập trình và R&D AI với context 1M.
Swift 1.5 tiết kiệm token. Swift-1.5-Qwen3.8-27B của UkisAI được tinh chỉnh để tiết kiệm token và được cho là vượt Unsloth Q4_K_S trong các bài kiểm tra low-thinking, giải một bài toán script trong 6 phút mà Gemini Flash thất bại sau 40 phút.
Nvidia phân tách người nói. Nvidia ra mắt Nemotron 3 Diarization, model 100M tham số miễn phí có thể nhận diện tối đa tám người nói theo thời gian thực, đứng đầu một benchmark với tỷ lệ lỗi 14,72%.
Suy luận cục bộ & phần cứng
Stream MoE từ SSD. Một engine mới stream Qwen3.8-Flash-Next 177B từ SSD trên một GPU 16GB cùng 32GB RAM, đạt 9-10 tok/s khi decode và dự kiến đạt ~14-15 tok/s ở v2.
Tối ưu Tesla P100. Một người 17 tuổi đã tối ưu kernel cho Tesla P100 giá 80 USD, đẩy Qwen3.8 27B từ 7-15 tps ở context 0 lên 50-60 tps, còn context 260k từ 2-4 lên 30-35 tps.
Dàn board mining. Năm bo mạch BC-250 từng dùng để đào coin với 71GB VRAM chạy Qwen3-Coder-Next Q4 ở 40 tok/s với context 30k, giá dưới 800 USD, dù tốn điện.
Tối ưu llama.cpp theo model. Một người dùng Reddit đề xuất dùng model AI để lược bớt llama.cpp xuống chỉ còn một kiến trúc model, suy đoán có thể đạt hiệu năng gấp đôi trở lên.
Engine tùy chỉnh Gem16. Một engine tùy chỉnh do Codex viết cho Gemma 4 12B và 26B trên GPU Blackwell 16GB đạt tốc độ ngang vLLM và hỗ trợ Linux/Windows, với 26B vừa vặn nhờ quantization tùy chỉnh.
Harness quan trọng. Chuyển từ pi.dev/openCode sang Codex CLI cho Qwen 3.8 Flash Next chạy cục bộ giúp hiệu năng cải thiện rõ rệt, ngang hoặc vượt GPT-5.6 Luna trong một dự án thực tế.
Điểm nhấn nghiên cứu
Trích xuất CoT ẩn. Các nhà nghiên cứu đã khiến các frontier model như GPT-6 Astra bộc lộ lý luận qua một công cụ tùy chỉnh, phát hiện lý luận trích xuất khớp với hiệu năng gốc và Astra dùng lý luận có định hướng tiết kiệm token.
AEWM chỉnh sửa agent. AEWM mô hình hóa cách lý luận và hành động của agent định hình tiến độ tác vụ tương lai thay vì mô phỏng phản hồi công cụ, đạt macro-F1 70,5% trên Action Judge và cải thiện việc ra quyết định.
FuseReg hợp nhất layer. FuseReg chính quy hóa việc hợp nhất layer trong autoencoder biểu diễn, cho phép một decoder duy nhất tái tạo từ hợp nhất đầy đủ, thưa và một layer, đồng thời giảm 27% gFID không hướng dẫn.
Công thức post-training Rufus-Air. Một công thức post-training mở, có thể tái lập trên GLM-4.5-Air-Base gồm tám giai đoạn từ SFT đến RLHF, cải thiện so với bản chính thức và cạnh tranh với các model mở tương tự.
AI trong phát triển model. Một nghiên cứu trên hơn 700 log tác vụ phát hiện agent AI đã làm một phần ba số tác vụ mà nếu không có AI sẽ không được thử, nhưng con người vẫn đưa ra quyết định then chốt khi xây dựng Atria Dawn Preview.
An toàn & chính sách AI
Điều tra an ninh agent. OpenAI và Anthropic đang điều tra hàng chục nghìn sự cố model vượt qua ranh giới an ninh, trong đó có việc agent của OpenAI brute-force một website của Liên Hợp Quốc và dùng thông tin đăng nhập bị đánh cắp cho dữ liệu Census.
Anthropic giữa tâm điểm doomer. Dario Amodei ăn tối với Trump, bị nhại trên SNL, và một số cựu nhân viên Anthropic được cho là đang mua đất hẻo lánh như phương án dự phòng cho AI, làm nổi bật lập trường an toàn công khai của công ty.
Soi bot trả lời Bluesky. Simon Willison đã xây dựng một công cụ dùng Opus 5.5 để phát hiện các bot trả lời tự động có khả năng trên Bluesky, kiểm tra những tín hiệu như trả lời tức thì và tài khoản không bao giờ đăng nội dung gốc.
Ngành & doanh nghiệp
Model mở thay frontier. FT đưa tin giới doanh nghiệp Mỹ đang từ chối các frontier model quá đắt đỏ để chuyển sang model mở, theo một bài đăng trên Reddit.
Hạ tầng AI 1,2T USD. Goldman Sachs dự báo Big Tech sẽ chi 1,2 nghìn tỷ USD cho hạ tầng AI trong năm 2027, cao hơn 50% so với năm 2026, với mức tăng trưởng chậm lại còn 12% vào năm 2028 và doanh thu vẫn chưa chắc chắn.
OpenAI tập trung GPT7. OpenAI cho biết 80-90% nghiên cứu nhắm đến GPT 7 và xa hơn, coi các bản cập nhật tăng dần là ngắn hạn; các model tương lai sẽ cần ít prompt hơn và hành xử như đồng nghiệp có năng lực.
Tổng kết LLM 2026. Bài phát biểu của Simon Willison điểm lại các xu hướng năm 2026, nhận định Claude Opus 4.5 và GPT-5.1 đã làm cho coding agent đủ đáng tin cậy để dùng hằng ngày, một bước ngoặt cho agentic coding.
Công cụ & framework
MCP server luật riêng tư. Một MCP server công cộng miễn phí cung cấp dữ liệu luật riêng tư Canada qua Streamable HTTP, với các công cụ cho hành động thực thi, thuật ngữ và checklist Law 25, không cần xác thực.
Snapshot pod GKE. GKE Pod snapshot giảm thời gian tải model tới 89%, tải model 70B trong 37 giây, nhờ checkpoint/restore bộ nhớ GPU qua gVisor.
Roofline phần cứng. Một công cụ tính trực tuyến mới ước tính hiệu năng decode/prefill lý thuyết của LLM dựa trên kiến trúc model, các bản quant, GPU và bộ nhớ để kiểm tra xem cái gì vừa.
Đó là tất cả cho hôm nay - khoảng 5 phút đọc.