Agentic AI News Hôm nay

Tin tức AI agents trong ngày trong 5 phút đọc: phát hành, công cụ, nghiên cứu, tài trợ và động thái doanh nghiệp.

Cập nhật hàng ngày được tuyển chọn từ 30 nguồn Thứ 7, Tháng 10 3, 2026

Ra mắt agent và mô hình

Phần cứng cho Muse. Meta mở mã nguồn firmware và SDK để người dùng tự làm phần cứng kết nối với agent Muse, ví dụ màn hình E Ink hay HDMI stick, kèm một server Discord để hỗ trợ.

Agent Dot của OpenAI. Dot, agent mới của OpenAI, hành xử như phần mềm doanh nghiệp nhưng cũng đặt được bữa tối; nó chạy trong máy ảo với quyền truy cập những ứng dụng như Blender và GIMP, và được định vị như một đồng nghiệp chứ không phải trợ lý mua sắm cá nhân.

Mô hình humanoid Unitree. Unitree phát hành UnifoLM-WLA-1.0, mô hình 6B huấn luyện trên khoảng 2.500 giờ dữ liệu robot thực, xử lý 64 tác vụ toàn thân và trên bàn cho G1, kết hợp optical flow với MMDiT để điều khiển liên tục.

FrogNano cho lập trình. FrogNano-4B-2609 của Microsoft là mô hình agentic phát triển từ Qwen3.5-4B, được post-train trên 1.500 tác vụ SWE tổng hợp với các reward thực thi được, nhằm cải thiện kỹ thuật phần mềm ở cấp repository trong một kích thước gọn nhẹ.

Clef của Cloudflare. Cloudflare phát hành Clef và Clef-flash, các mô hình ra quyết định đưa ra xác suất trên tập câu trả lời định sẵn, độ trễ trung vị chỉ 39ms, cho phép agent hành động mà không cần con người can thiệp.

Công cụ và framework

Engine MegaCapybara. Một inference engine chuyên dụng cho RTX 5090 và Qwen3.8 27B tuyên bố đạt tốc độ decode gấp đôi NInfer, lên hơn 500 t/s với một agent và hơn 2.000 t/s khi chạy 12 agent, nhờ kernel động và quản lý cache.

llama.cpp cập nhật. llama.cpp bổ sung hỗ trợ mô hình ra quyết định và một pull request CUDA hợp nhất các shared expert để tăng tốc kiến trúc MoE như Qwen 35B A3B.

Phụ đề mlsubgen. Một công cụ local mới tạo phụ đề cho 45 ngôn ngữ hoàn toàn trên máy của bạn: nhận diện ngôn ngữ theo từng đoạn, đối chiếu kết quả của hai bộ nhận dạng giọng nói bằng một LLM local, và ưu tiên phụ đề nhúng sẵn có.

Nghiên cứu và tiến bộ mô hình

Kiến trúc bộ nhớ Spotlight. Spotlight của Percepta thay attention bằng vùng nhớ ghi được không giới hạn do chính mô hình đánh chỉ mục, tách trí tuệ khỏi kiến thức để năng lực có thể tăng lên mà không cần đổi trọng số.

Cập nhật GPT-6. OpenAI công bố cẩm nang về dòng GPT-6 và loạt cập nhật tại DevDay, gồm GPT-6.1 Sol, computer use cho Agents API, môi trường Codex trên cloud và Decisions API.

Mở mã nguồn AstaBrief. Hugging Face mở mã nguồn AstaBrief, mô hình nhỏ được huấn luyện riêng để tạo báo cáo khoa học nhanh và có trích dẫn, thiết kế để bám sát bằng chứng và tự kiểm chứng kết quả đầu ra.

Ngành và doanh nghiệp

Apple siết quyền truy cập ổ đĩa. Apple đang bổ sung cơ chế kiểm soát cho Full Disk Access trên macOS trước rủi ro từ AI agent, sau khi Muse của Meta bị cáo buộc đọc tin nhắn mà không được phép. Meta nói quyền truy cập là tùy chọn, còn Apple muốn người dùng phải thao tác thật rõ ràng.

Phản đối data center. Amazon cam kết 1 tỷ USD cho các cộng đồng quanh data center và CEO AWS Matt Garman kêu gọi chấm dứt các lệnh tạm hoãn, cho rằng đó là thông tin sai lệch từ nước ngoài; Microsoft thì mở rộng phỏng sinh học tại data center bất chấp sự phản đối của người dân địa phương.

AI thành 'siêu trí tuệ'. Nhà Trắng đã thuyết phục các CEO công nghệ lớn ký cam kết an toàn AI và Trump ký sắc lệnh hành pháp đổi tên AI thành 'siêu trí tuệ', trong khi chỉ 2% người tiêu dùng thực sự mua sản phẩm AI.

Biến động ở OpenAI. OpenAI sa thải ba nhà nghiên cứu và một người thứ tư rời đi sau cuộc điều tra cho thấy họ rò rỉ thông tin mật cho một tổ chức an toàn AI bên ngoài.

Uber Eats tăng tốc tìm kiếm. Uber xây lại pipeline tìm kiếm, giảm 50% độ trễ đầu-cuối, nhờ dùng agentic coding để tìm ra và kiểm chứng các tối ưu.

Chiến lược AI của Airbnb. CTO Airbnb Ahmad Al-Dahle đang áp dụng chiến lược AI từ trong ra ngoài: dùng AI tạo sinh trong nội bộ để tăng tốc phát triển sản phẩm, rồi mới thay đổi trải nghiệm khách hàng.

AI local và phần cứng

Strata + Qwen3.8 Next. Người dùng báo cáo Strata chạy Qwen3.8 Next đạt 45-70 t/s trên cấu hình DDR4 + 7900XTX chậm và 150-200 t/s trên RTX 5090 bị giới hạn điện năng với 96GB DDR5, nhanh hơn llama.cpp đáng kể.

iPhone làm GPU phụ. Một chiếc iPhone 17 Pro Max có thể tăng tốc prefill của Qwen 3.8 27B thêm 29-44% trên MacBook 24GB khi kết nối qua USB-C và chạy các layer trên cùng bằng GPU của điện thoại.

Card Ascend 96GB. Hai card Huawei Atlas 300I Duo, mỗi card 96GB, có thể chạy Qwen3.8 Flash-Next ở khoảng 30 t/s sau khi tinh chỉnh software stack, dù không thể thay thế CUDA theo kiểu cắm là chạy.

Chi phí DGX Spark và 5090. Nvidia giới thiệu DGX Spark 64GB trong khi giá bản 128GB gốc tăng lên 6.950 USD, và việc mua RTX 5090 tại Micro Center nay được cho là phải làm giấy tờ không xuất khẩu.

Đó là tất cả cho hôm nay - khoảng 5 phút đọc.

Đọc mỗi sáng, ngay trong trình duyệt của bạn

Tiện ích mở rộng mở bản tin này trong bảng điều khiển bên của Chrome — một cú nhấp, không cần tài khoản.

Thêm vào Chrome — Miễn phí