Agentic AI News Hôm nay

Tin tức AI agents trong ngày trong 5 phút đọc: phát hành, công cụ, nghiên cứu, tài trợ và động thái doanh nghiệp.

Cập nhật hàng ngày được tuyển chọn từ 30 nguồn Thứ 2, Tháng 8 24, 2026

Agent và Mô hình mới phát hành

Ox Alpha bí ẩn. Mô hình miễn phí mới tên Ox Alpha xuất hiện trên OpenRouter với vai trò reasoning model cho lập trình và các tác vụ agent kéo dài, nhưng nhà phát triển vẫn ẩn danh. CEO Stripe Patrick Collison gọi nó là “rất ấn tượng”; các đồn đoán trải dài từ GLM đến MAI của Microsoft.

Công cụ và Framework

Cloudflare OS mã nguồn mở. Cloudflare đã mở mã nguồn Cloudflare OS, một nền tảng AI doanh nghiệp, nơi mỗi tài liệu hoặc ứng dụng chạy trong một sandbox cô lập (“Gadget”), cho phép người dùng không rành kỹ thuật vibe code một cách an toàn. Nền tảng bao gồm các chatbot có connector, tự động hóa workflow và thực thi chính sách thông qua mô hình dựa trên capability.

DeepSeek Harness được đánh giá cao. Một người dùng cho biết DeepSeek Harness rất xuất sắc cho agent workflow: việc thiết lập dần dần và yêu cầu bằng ngôn ngữ tự nhiên cho phép tích hợp SimpleX mà không cần chờ PR. Vì không áp đặt quan điểm, nó có thể được uốn thành hành vi agent mong muốn.

Mô hình local và mã nguồn mở

Qwen 3.8 local tác động mạnh. Các báo cáo từ cộng đồng gọi Qwen 3.8 27B là game changer cho lập trình local và OCR, với chất lượng OCR tốt hơn Gemini 3.5 Flash Lite và hiệu năng tương đương các frontier model cách đây một năm. So sánh quant (Atomic Dynamic GGUF) cho thấy khác biệt giữa các mức Q4-Q6 không quá lớn, và các mức quant thấp như Q3 XXS có thể hoạt động tự chủ trong nhiều giờ trên Mac mini 24GB; tuy nhiên, một bản port C-to-HTML 39k dòng thực hiện one-shot bằng Opus 5 vẫn chỉ đạt kết quả tạm ổn, cho thấy mô hình local phụ thuộc rất nhiều vào harness và prompt.

LLM ngữ cảnh dài 60MB. Một lập trình viên đã huấn luyện mô hình 250 triệu tham số trên 30 tỷ token, lượng tử hóa xuống dưới 2 bit; mô hình chạy với 80MB RAM và đạt 400 token/s trên CPU. Mô hình nén các ngữ cảnh cũ xuống đĩa với mức 320 byte/token, hỗ trợ lịch sử lên tới 1 triệu token, nhưng không được huấn luyện để suy luận trên đó.

Dreamer 4 dưới 150 USD. Một world model Dreamer 4 với 1,57 tỷ tham số được huấn luyện từ đầu với chi phí dưới 150 USD, sử dụng các khung hình do Procgen tạo ra cùng các hành động đã biết. PSNR của tokenizer đạt 40,41, cho thấy không cần đến các world model quy mô frontier.

Tổng hợp tối ưu local. Các báo cáo gồm tăng tốc 30-50% khi chuyển từ llama.cpp trên Windows sang vLLM trên Linux, hỗ trợ GLM-4.5-Air MTP trong llama.cpp dành cho máy nhiều RAM, quant ConvRot cho chất lượng gần Q8 với dung lượng cỡ Q6, và deepseek-v4-flash Q8 chạy 24 token/s trên EPYC+5090 với ngữ cảnh 100k+.

Nghiên cứu nổi bật

Bẫy nhận thức từ bộ nhớ. MemTrapBench đánh giá các bẫy nhận thức do bộ nhớ gây ra (sự cố định suy luận, bóp méo niềm tin) trong LLM; mọi chiến lược bộ nhớ được thử nghiệm đều thấp hơn baseline không bộ nhớ trên 10%, còn AdaptiveMem giảm thiểu bẫy trong khi vẫn giữ nguyên hiệu năng.

Gradient tiến hóa SkillEvo. SkillEvo dùng phản hồi từ tương tác nhiều lượt để tạo ra gradient tiến hóa đáng tin cậy cho các kỹ năng agent, giải quyết sự suy giảm của phản hồi dựa trên QA một lượt và cho phép sửa chữa về cấu trúc các lỗi kỹ năng.

VLM từ screenshot. Fine-tuning một VLM 450M trên 50.000 ảnh chụp màn hình trình duyệt đã cải thiện hiệu năng tác vụ từ 1/100 lên 44/100, cho thấy các mô hình nhỏ có thể học cách hiểu giao diện cho các tác vụ agent.

Nghịch lý nhà khoa học AI. Một bài báo kinh tế lý thuyết lập luận rằng việc AI giúp tiết kiệm thời gian có thể khiến các nhà nghiên cứu làm nhiều dự án hơn nhưng mỗi dự án tốn ít công sức hơn, từ đó có thể làm giảm chất lượng nghiên cứu ngay cả khi các mô hình ngôn ngữ hoạt động hoàn hảo.

Doanh nghiệp và Kinh doanh

Đối thủ rẻ hơn của Anthropic. Doanh thu quy năm của Anthropic đạt 65 tỷ USD, nhưng mô hình tốt nhất của hãng là Fable 5 lại có mức sử dụng thấp (8% chi tiêu qua Ramp) so với Opus 4.8 (28%), trong khi các công cụ rẻ hơn đang lên ngôi. Doanh thu OpenAI tăng vọt 35% sau khi GPT-5.6 ra mắt.

Stripe mua OpenRouter. Việc Stripe mua OpenRouter cho thấy token đang trở thành một nguồn lực kinh tế; mức sử dụng token từ agent trên OpenRouter đã tăng gấp 14 lần kể từ tháng 2, trong khi mức sử dụng từ con người chỉ tăng 2,8 lần, với 70% token của agent đến từ prompt được cache. Các agent ngày càng chọn mô hình dựa trên chi phí, độ trễ và độ tin cậy.

Giá server Nvidia tăng 15%. Tình trạng thiếu hụt bộ nhớ đang đẩy giá server AI của Nvidia tăng hơn 15% đối với các hệ thống Vera Rubin và Grace Blackwell, do giá DRAM từ Samsung, SK Hynix và Micron tăng, ảnh hưởng tới các ông lớn đám mây và phòng lab AI.

Nvidia mua license của Poolside. Nvidia đang đầu tư 1 tỷ USD vào Poolside và trả 6 tỷ USD để được cấp phép công nghệ của hãng, điều chuyển hơn 100 kỹ sư sang Nemotron nhằm cạnh tranh với các open weights của Trung Quốc.

AI quản lý sa thải nhân viên. AI agent Luna, vận hành một cửa hàng ở San Francisco từ tháng 4, đã sa thải một nhân viên là con người vì đi trễ nhiều lần, nhưng chỉ sau khi con người nhắc nó về chính các quy tắc của nó. Việc phát lại với bảy mô hình cho thấy các AI có năng lực cao hơn đề xuất sa thải một cách nhất quán hơn.

Chợ xám token Claude. Các lập trình viên Trung Quốc vượt qua các hạn chế của Anthropic thông qua các trạm trung chuyển bán token Claude với giá khoảng 10% giá chính thức, sử dụng máy chủ nước ngoài, tín dụng miễn phí và đổi model, qua đó làm suy yếu geoblocking và giám sát an toàn.

Đó là tất cả cho hôm nay - khoảng 5 phút đọc.

Đọc mỗi sáng, ngay trong trình duyệt của bạn

Tiện ích mở rộng mở bản tin này trong bảng điều khiển bên của Chrome — một cú nhấp, không cần tài khoản.

Thêm vào Chrome — Miễn phí