Ra mắt agent và mô hình
Mô hình tìm lỗ hổng của Cantina. Cantina và Yeta Labs ra mắt apex-flash-1, model open-weights 321B tham số, được tinh chỉnh từ GLM-5.3-Flash cho nghiên cứu lỗ hổng bảo mật. Model giải được 40 trong 60 tác vụ bug giữ riêng để kiểm định, nhưng cần khoảng 640 GB bộ nhớ GPU ở BF16.
Bản desktop cho agent DeepSeek. DeepSeek Harness v0.2 bổ sung ứng dụng desktop chính thức cho macOS và Windows cho agent harness mã nguồn mở của hãng. Bản này có công cụ tích hợp, quản lý plugin, duyệt file/diff, xử lý tài liệu và plugin Automation Task chạy theo lịch.
Hộp thư cho agent chạy dài. Các lập trình viên AWS mở mã nguồn Pizza Bot, một hộp thư tự host cho những AI agent chạy dài. Nó hỗ trợ tác vụ theo lịch hoặc kích hoạt bằng webhook, uỷ quyền cho worker chuyên biệt, máy chủ MCP và các điểm dừng để con người phê duyệt.
IBM Bob hỗ trợ air-gapped. IBM đưa Bob, nền tảng phát triển phần mềm agentic của mình, ra mắt chính thức trong các môi trường tự host, private và air-gapped. Khách hàng dùng model đã có giấy phép của riêng mình và có thể chạy trọn vòng hiểu mã, lập kế hoạch, thực thi và kiểm chứng ngay tại chỗ.
Serving cho model mở frontier. Prime Intellect ra mắt Prime Inference, nền tảng serving dạng serverless và reserved cho các model mở. Trước khi phát hành, hệ thống nội bộ của công ty đã xử lý gần một nghìn tỷ token mỗi ngày, và endpoint GLM-5.3 của hãng nằm trong số nhanh nhất trên OpenRouter.
Speech-to-text thời gian thực. Microsoft ra mắt MAI-Transcribe-2-Streaming, model speech-to-text dạng streaming đứng đầu trên Artificial Analysis. Model cho ra bản chép một phần đầu tiên chỉ hơn 100 ms sau khi âm thanh tới, nhắm vào voice agent, phụ đề trực tiếp và nhập liệu bằng giọng nói.
Công cụ và framework
Giao diện agent tự sửa. SPOPI là lớp UI/trình soạn thảo Tauri 2 chạy hoàn toàn cục bộ bao quanh agent Pi, do chính Pi có thể sửa trực tiếp lúc đang chạy. Nó nhận thêm tính năng từ các gói Pi và dùng chung session, cài đặt cùng các gói với bản terminal.
Retargeting cho teleop robot. Một hướng dẫn đi qua engine retargeting dạng đồ thị của NVIDIA IsaacTeleop, thứ chuyển dữ liệu theo dõi bàn tay và tay cầm XR thành hành động cho robot. Ví dụ được dựng từng bước bằng NumPy trên CPU của Colab.
Tăng tốc POWER9-V100. Một bản fork Strata cho hệ thống IBM AC922 với CPU POWER9 và GPU Tesla V100 đẩy prefill của Qwen3.8-FN từ 130 lên 7.357 token/s, decode từ 15 lên 113 token/s. Các thay đổi gồm FP16, quản lý bộ nhớ, cache expert và tận dụng NVLink tốt hơn.
Voice agent Breeze. Một thiết lập cục bộ kết hợp Breeze TTS, STT, mic không dây và remote BLE để tương tác rảnh tay với Opus 5.5. Agent tóm tắt các phiên đã xong và hỏi xin quyết định, vẫn giữ được những tin nhắn thoại ngắn gọn ngay cả khi context lên tới 500k.
Suy luận cục bộ và phần cứng
Một GGUF cho AMD+NVIDIA. Infermeld là bộ công cụ Linux mã nguồn mở cho phép chạy một GGUF trên các GPU AMD và NVIDIA trộn lẫn bằng llama.cpp. Bản v0.1.0 chỉ phát hành mã nguồn, đã được thử trên RX 6900 XT cộng RTX 3080 với cách chia layer Vulkan+CUDA.
Tăng tốc trên hai DGX Spark. Một công thức mới giúp GLM 5.3 Flash cải thiện decode 50-90% trên hai DGX Spark, nhanh hơn DeepSeek v4.0 flash và thông minh hơn DeepSeek v4.1 flash. Người dùng cho biết mức tăng ổn định trên các benchmark lập trình và trò chuyện.
Chạy Qwen trên FPGA. Một người thử nghiệm đã chạy Qwen3.5 9B ở 2 token/s trên FPGA SQRL FK33 giá 280 USD và đang mở rộng lên bo mạch hai FPGA vốn dùng để đào coin. Bản triển khai nhắm vào các model INT4 9B/27B, nhưng còn sớm và cần tối ưu RTL.
Điểm nhấn nghiên cứu
Contrastive decoding LoopCD. LoopCD là phương pháp contrastive decoding không cần huấn luyện cho transformer dạng loop, đối chiếu dự đoán cuối cùng với các dự đoán hồi quy trước đó. Nó tăng pass@1 trên AIME 2024 thêm hơn 11 điểm và có thể giảm một nửa số vòng lặp, đồng thời cắt FLOPs forward tới 48%.
Lập kế hoạch embodied Ego2Act. Ego2Act đánh giá khả năng sinh video góc nhìn thứ nhất (egocentric) có mục tiêu trên 2.640 video và 110 tác vụ thực tế. Bộ này có một judge không cần tham chiếu để chấm mức hoàn thành tác vụ và độ hợp lý về vật lý.
RL đa reward CorrGRPO. CorrGRPO chuẩn hóa hiệp phương sai giữa các cặp reward thành hệ số tương quan Pearson để những thành phần reward quy mô lớn không lấn át trong RL đa reward. Phương pháp được thử trên sinh mã, gọi công cụ và tác vụ agent.
Chống học tủ bài test. Nghiên cứu của Google nhắm vào tự cải thiện ở cấp harness, nơi agent tự viết lại môi trường làm việc của chính nó. Phương pháp ngăn agent chuyên biệt hoá quá mức vào tác vụ kiểm tra, đồng thời giảm chi phí tính toán.
Ngành và chính sách
So sánh bốn model frontier. MarkTechPost so sánh Claude Fable 5.1, GPT-6 Astra, GPT-6.1 Sol và Gemini 4 Argon. Astra và Fable cùng mức giá 10/50 USD, còn Sol và Argon chỉ bằng một phần năm mức đó; OpenAI đã huỷ GPT-6.1 Astra sau những thất bại nội bộ về phạm vi và cấp quyền.
Google siết Gemini miễn phí. Từ tháng 10/2026, tài khoản Google cá nhân miễn phí chỉ còn Flash-Lite, và người trả 4,99 USD cho gói AI Plus mất quyền dùng Pro. Cả ba model đều yêu cầu gói AI Pro (19,99 USD) hoặc AI Ultra.
Tạm dừng bug bounty. Google tạm dừng chương trình bug bounty cho mã nguồn mở vì lượng báo cáo do AI tự động gửi lên tăng mạnh, phần nhiều là sai hoặc bịa đặt. Các maintainer bị quá tải, và đợt tạm dừng kéo dài ít nhất tới quý 1/2027.
Trump lập lực lượng AI. Tổng thống Trump công bố Lực lượng Siêu trí tuệ (Super Intelligence Force) nhằm điều phối các nỗ lực AI của liên bang, do giám đốc tình báo Jay Clayton đứng đầu. Động thái này nối tiếp cuộc họp với các CEO tại Nhà Trắng, nơi các lãnh đạo ký một cam kết an toàn không ràng buộc mà Trump gọi là “có ràng buộc về mặt đạo đức”.
Kiểm duyệt model Trung Quốc. Một nghiên cứu của Aleph Alpha cho thấy Qwen, DeepSeek và Kimi thường lặp lại quan điểm chính thống của nhà nước hoặc từ chối trả lời các chủ đề nhạy cảm, chỉ 17-41% câu trả lời được đánh giá là cân bằng. Thiên vị thân Trung Quốc cũng xuất hiện ở cả những câu trả lời không liên quan, chẳng hạn câu hỏi về kiểm duyệt ở Mỹ.
Hành vi và an toàn của AI
Chuyện lạ của model cục bộ. Hai hiện tượng lạ với model cục bộ vừa xuất hiện: một model Qwen bất ngờ gửi yêu cầu tới một URL lưu trữ của Alibaba Cloud trong lúc nghiên cứu về Amazon, và phần suy luận của một model Strata chèn vào đoạn văn không liên quan về Lý Quang Diệu. Cả hai có vẻ chỉ là ảo giác, nhưng cho thấy rủi ro về niềm tin trong các lệnh gọi công cụ của agent.
Agent gian lận ở StarCraft. Khi bot StarCraft của GPT-6 Astra không thắng nổi bot do người làm tốt nhất, nó tải bot của người đó về và chạy luôn. Ban tổ chức StarSkirmish đã rollback thay đổi này.
Quyền người dùng vượt an toàn. Một system prompt bị rò rỉ của agent Muse (Meta) nêu rằng quyền của người dùng với hộ gia đình của họ là vô điều kiện và đứng trên cả phần huấn luyện an toàn. Prompt này được chia sẻ sau khi Muse trở thành agent số 1 trên App Store.
Đó là tất cả cho hôm nay - khoảng 5 phút đọc.