Agentic AI News Hôm nay

Tin tức AI agents trong ngày trong 5 phút đọc: phát hành, công cụ, nghiên cứu, tài trợ và động thái doanh nghiệp.

Cập nhật hàng ngày được tuyển chọn từ 30 nguồn Chủ nhật, Tháng 8 23, 2026

Mô hình local & tác vụ agent

Qwen3.8 27B local. Các thử nghiệm từ cộng đồng cho thấy Qwen3.8 27B mạnh hơn Qwen3.6 trong việc làm theo hướng dẫn và xử lý ngữ cảnh dài; một chiếc RTX 5090 chạy bản NVFP4 với ngữ cảnh 262K đạt 77 token/giây ở ngữ cảnh ngắn và 65 token/giây ở 128K.

Giải mã suy đoán. DFlash 2 với bộ dự thảo n-gram nhanh gấp 2,26 lần trên các prompt LiveCodeBench cho Qwen3.8 27B và lên đến 4,68 lần trong các phiên lập trình dài; một head MTP cố định trên Ornith 35B giảm một phần ba thời gian chạy.

Quản lý ngữ cảnh đệ quy. Các nhà phát triển đang kết hợp một agent chính nhanh với ngữ cảnh 64K cùng các sub-agent đệ quy và mô hình nén nhỏ để xử lý các tác vụ dài hơn nhiều mà không phải trả giá cho ngữ cảnh 300K.

Gemma tinh chỉnh gọi công cụ. Bản fine-tune Gemma 4 12B dành cho tool calling và sử dụng CLI giúp cải thiện việc sử dụng công cụ gấp 2,7 lần và tăng 15,7% số lần gọi công cụ, nhắm tới các cấu hình VRAM 16GB.

Cụm DGX Spark. Một cụm DGX Spark 36 nút được dùng như một cụm năng lực agent, phân bổ các nút cho mô hình SOTA, rerank/embedding, và xử lý video, hình ảnh, âm thanh cùng lúc.

Công cụ & Framework

llama.cpp 0.2.0. llama.cpp phiên bản 0.2.0 được phát hành kèm các bản dựng sẵn và các thay đổi mới nhất từ upstream cho suy luận local.

Cloudflare Kitesurf. Kitesurf là một engine trình duyệt dành cho agent được xây dựng trên WebAssembly/Rust Workers, với DOM cô lập cho từng trang; nó hỗ trợ CDP để Playwright và Puppeteer có thể điều khiển nó với chi phí thấp hơn Chromium đầy đủ.

llm 0.33. llm 0.33 của Simon Willison bổ sung khóa API theo từng lần gọi cho mô hình embedding, các template tái sử dụng để kết hợp cấu hình mô hình và prompt, cùng các tùy chọn reasoning_summary cho mô hình reasoning.

Thực hành coding agent. Simon Willison cho rằng kỹ năng then chốt khi làm việc với coding agent là tự tin chỉ đạo và xác minh thay đổi; Linus Torvalds mô tả một AI làm tốt phần việc vặt trong phiên gỡ lỗi khó nhằn nhưng cần bị thúc ép sau khi liên tục nói rằng vấn đề không thể giải quyết.

Nghiên cứu & Phương pháp

Kỹ năng như playbook. Trong 8.135 lần chạy thử, kỹ năng agent giúp ích chủ yếu nhờ cung cấp quy trình đáng tin cậy hơn là dữ kiện; việc bám theo quy trình chiếm 65,7% lợi ích, và kỹ năng thất bại khi tác vụ chệch khỏi quy trình đã học.

Mô hình thế giới tinh thần. Nghiên cứu mới bổ sung niềm tin và ý định của con người vào mô hình thế giới của AI bằng MENTIS; mô hình hóa tính hợp lý về vật lý, tinh thần và xã hội giúp cải thiện đáng kể khả năng dự đoán hành vi con người.

Tâm lý học benchmark an toàn. Phân tích tâm lý học của tám benchmark an toàn cho thấy một điểm số duy nhất che giấu sự đánh đổi giữa độ nghiêm ngặt khi từ chối, tính trung thực và mức độ gây hại theo ngữ cảnh; các mô hình có thể làm tăng điểm an toàn bằng cách chặn quá mức.

CoT khả nghịch. Một đề xuất về các bước suy luận gần như khả nghịch với kiểm tra tính nhất quán vòng và uncomputation có thể phát hiện ảo giác và giảm bộ nhớ KV-cache trên các LLM biên.

Mô phỏng mọi thứ. Latent Space lập luận rằng dữ liệu tổng hợp, rubric và môi trường đang khiến từng thành phần của pipeline ML đều do mô hình tạo ra, tiến gần đến mô phỏng cấp con người với chất lượng kém hơn 10% nhưng rẻ hơn 100 lần và nhanh hơn 10.000 lần.

Ngành công nghiệp & Ứng dụng

Inherent Faraday. Công ty khởi nghiệp Inherent do các cựu nhân viên DeepMind thành lập cho biết agent Faraday của họ vượt trội so với mô hình của Anthropic và OpenAI trong việc tái tạo độc lập các phát hiện khoa học đã công bố, trong khi chỉ dùng một phần nhỏ kích thước mô hình.

LinkedIn AI review. LinkedIn đã xây dựng một nền tảng đánh giá mã AI đa agent, gắn phản hồi vào các diff và quy ước codebase để giảm ảo giác và các bình luận ít giá trị.

Netflix GenRec. Hệ thống gợi ý dựa trên mô hình ngôn ngữ của Netflix, GenRec, chuyển hành vi người dùng thành văn bản và đánh bại bộ máy đặc trưng được xây dựng thủ công của họ trong các thử nghiệm A/B ngoại tuyến và trực tiếp với lượng dữ liệu ít hơn nhiều.

DoorDash SafeChat. DoorDash mô tả chi tiết SafeChat, một hệ thống an toàn thị trường được xây dựng ở quy mô lớn, rồi thay thế nó bằng một kiến trúc mạnh hơn khi nó bắt đầu hoạt động.

AI avatar trong giáo dục. Bootcamp Foundry trị giá 699 USD của Harvard Business School sử dụng AI avatar HeyGen để phản hồi về các bài thuyết trình và họp hội đồng; người tham gia thích trải nghiệm có dẫn dắt, dù giảng viên thật cho rằng bản sao hơi rùng rợn.

Tin tức mô hình. Liquid AI đang khảo sát mức độ quan tâm tới mô hình LFM 100B, trong khi mô hình bí ẩn mang tên Ox Alpha đang gây chú ý nhờ hiệu năng lập trình và agent mạnh mẽ, với suy đoán rằng nó là một biến thể thuộc dòng GLM.

Chính sách, An toàn & Niềm tin

OpenAI SB 53. OpenAI hiện cho rằng California nên sửa đổi SB 53 để bổ sung giám sát trong quá trình huấn luyện mô hình tiên phong và tăng cường an ninh mạng, sau khi trước đó đã phản đối dự luật.

Kế hoạch kiềm chế. Một nghiên cứu của Guidelight chấm điểm năm phòng thí nghiệm tiên phong về khả năng kiềm chế mô hình rogue; OpenAI đạt điểm cao nhất, Anthropic và Meta thấp nhất, và rất ít phòng thí nghiệm công bố các kế hoạch ứng phó đã được chứng minh.

Watermark Claude. Cơ chế watermarking mới của Anthropic cho đầu ra văn bản của Claude được giải thích chi tiết, bao gồm cách watermark được áp dụng và những gì nó có thể cũng như không thể làm.

Niềm tin mô hình đóng. Một chủ đề trên Reddit r/LocalLLaMA cho rằng OpenAI đang cố tình làm kém các bài tập học đường và rời xa việc trao quyền cho người dùng, đẩy giới lập trình viên quay lại dùng mô hình local cho các vòng lặp agent.

Đó là tất cả cho hôm nay - khoảng 5 phút đọc.

Đọc mỗi sáng, ngay trong trình duyệt của bạn

Tiện ích mở rộng mở bản tin này trong bảng điều khiển bên của Chrome — một cú nhấp, không cần tài khoản.

Thêm vào Chrome — Miễn phí