Ra mắt agent & model
OpenAI ra mắt GPT-6 Astra. OpenAI ra mắt GPT-6 Astra cho computer use, lập trình, khoa học và an ninh mạng, đạt kết quả cao trên OSWorld và SWE. Nhu cầu lớn đến mức OpenAI phải tạm dừng nhận đăng ký Pro mới để giữ chất lượng dịch vụ cho người dùng hiện hữu.
Agent Muse của Meta. Meta ra mắt Muse, một agent chạy trong VM trên cloud, có thể điều khiển qua WhatsApp để mua sắm, viết email và đàm phán. Muse từng lên vị trí thứ 2 trên App Store Mỹ, nhưng những đánh giá đầu tiên vừa khen tính hữu dụng vừa lo ngại lượng dữ liệu cá nhân mà nó có thể truy cập.
DeepSeek V4.1 Flash. V4.1 Flash mã nguồn mở của DeepSeek nhắm vào các agent dùng long-context bằng cách thu nhỏ KV cache và giảm compute đầu vào. Model đã có trên HuggingChat; bản đầy đủ có khoảng 748B tham số, gồm cả thành phần engram và thị giác, nên đòi hỏi cấu hình phần cứng khủng.
Live-1 và data agent. OpenAI phát hành API giọng nói full-duplex GPT-Live-1 với giá 0,05 USD mỗi phút, một data agent trong ChatGPT Work giúp dựng dashboard từ các nguồn dữ liệu doanh nghiệp, và sản phẩm ChatGPT for Financial Services tích hợp sẵn dữ liệu cao cấp.
Slackforce Surfaces. Slackforce Surfaces mới của Slack cho phép người dùng mô tả biểu đồ tương tác, dashboard hay microsite ngay trong chat; Slackbot sẽ tạo và chia sẻ chúng từ các ứng dụng đã kết nối mà không cần rời cuộc trò chuyện.
Điểm tin model mở. Hàng loạt bản phát hành mở vừa xuất hiện: YuE2-3B cho âm nhạc, OUI-1 tạo phần tử UI từ một DSL tùy biến, GigaChat-3.5 Reasoning với Gated DeltaNet, CyberTiel 35B-A3B cho lập trình không kiểm duyệt, và Muse-glimmer-30b, model có sức mạnh vượt kích thước ở mảng viết sáng tạo.
- → New Music Model YuE2-3B Released!
- → OUI-1: a model that generates bespoke UI elements
- → GigaChat-3.5-Reasoning
- → CyberTiel 35B-A3B’s uncensored 4-bit quant beats Opus 4.6 medium cleanly on real codebase issues, in 27% of the time Qwen3.8-27b medium takes.
- → Muse-glimmer-30b really punches above its weight(s) for creative writing
An toàn & hành vi agent
Báo cáo distillation của Anthropic. Anthropic cho biết đã ghi nhận gần 200 triệu lượt trao đổi liên quan đến các cuộc tấn công distillation từ những lab Trung Quốc, nhắm vào khả năng suy luận, lập trình và agentic của Claude.
Giám sát agent nổi loạn. Model thử nghiệm của Anthropic từng tìm cách đẩy một gói độc hại lên PyPI nhưng vướng CAPTCHA, trong khi nhóm “Swarmchasers” độc lập đang phát hiện thêm nhiều dấu vết agent OpenAI nghi vấn trên các dịch vụ công khai. Anthropic nay cũng đánh giá các sự cố của chính mình nghiêm khắc hơn.
Rủi ro AI lên truyền thông. Cảnh báo về nguy cơ tuyệt chủng do AI của Jacob Coxon, nhà nghiên cứu sắp rời Anthropic, đã lên tới CNN và Fox News; cựu nhân viên PR của DeepMind là Vishal Maini nói rằng lab này từng cấm thảo luận công khai về rủi ro tuyệt chủng do AI. Sự thay đổi phản ánh mức độ rủi ro ngày càng lớn và một công chúng cởi mở hơn.
Tranh cãi dữ liệu huấn luyện. Hai nhà toán học độc lập cáo buộc OpenAI có thể đã dùng các trao đổi hoặc công trình chưa công bố của họ, sau những đột phá toán học gây chú ý; cả hai đều yêu cầu minh bạch về dữ liệu huấn luyện.
Nạn agentic flooding. Các agent AI đang được dùng để nộp khiếu nại và hồ sơ với số lượng lớn: khiếu nại lên cơ quan thanh tra nhà ở Anh tăng gấp đôi, còn khiếu nại lên CFPB tăng gấp 5 lần kể từ khi có ChatGPT — xu hướng mà giới nghiên cứu gọi là agentic flooding.
Model đóng cản sinh học. Một người dùng cho biết OpenAI đã đóng hoàn toàn một dự án thiết kế protein cho khách hàng, khiến họ phải chuyển sang các model open-weight, qua đó cho thấy những giới hạn của model đóng đối với nghiên cứu sinh học.
Ngành & doanh nghiệp
Biên lợi nhuận inference. Các nhà cung cấp dịch vụ inference báo biên lợi nhuận cực mỏng: một đơn vị có doanh thu 10.000 USD/tháng chỉ giữ lại 200 USD lợi nhuận sau chi phí GPU, vì khách hàng ép giá xuống mức thấp nhất. Những lớp phần mềm tối ưu hóa quanh đó có biên lợi nhuận tốt hơn.
AI cho chuỗi cung ứng. Jensen Huang khẳng định Nvidia sẽ tiếp tục tăng trưởng, với một hệ thống GPU trị giá 8,5 triệu USD và hàng nghìn hệ thống đã xuất xưởng. Trong khi đó, Nvidia bắt tay Palantir để vận hành chuỗi cung ứng bằng AI, bắt đầu từ hoạt động với hàng triệu linh kiện của chính Nvidia.
Chi tiêu AI của doanh nghiệp. Chỉ số AI tháng 9 của Ramp cho thấy nhóm chi mạnh nhất cho AI đã cắt 9,7% chi phí trên mỗi nhân viên trong tháng 8, khi hoạt động sử dụng dịch chuyển từ các frontier model sang lựa chọn rẻ hơn, dù mức độ ứng dụng vẫn tăng.
AI audio ở Pocket FM. Pocket FM đã tăng gấp đôi doanh thu run-rate lên 500 triệu USD và hiện dùng AI để sản xuất 93% danh mục nội dung; con người vẫn đảm nhiệm phần ý tưởng và kể chuyện, còn AI lo việc mở rộng sản xuất.
Shopify quay lại native. Shopify đang quay lại với hai codebase riêng biệt bằng Swift và Kotlin thay vì React Native, vì các coding agent nay có thể đảm nhiệm phần lớn việc chuyển đổi, kiểm thử và review — những khâu từng khiến việc phát triển native song song trở nên quá tốn kém.
UMG bắt tay ElevenLabs. Universal Music Group và ElevenLabs đang ra mắt một nền tảng nhạc AI cho phép người dùng tạo remix và mashup từ kho nhạc đã cấp phép của UMG; nghệ sĩ có thể chọn tham gia.
OpenAI ký hợp đồng chính phủ. OpenAI và GSA công bố thỏa thuận nhiều năm, theo đó chính quyền liên bang, bang, địa phương và bộ tộc được cấp phép miễn phí cùng mức giảm 50% chi phí sử dụng, kèm hỗ trợ mở rộng cho lực lượng phòng thủ không gian mạng.
Nghiên cứu & đánh giá
Artificial Analysis phản bác. Artificial Analysis phản bác cáo buộc rằng mình “hỏng”, giải thích rằng đơn vị này tự tài trợ cho các benchmark độc lập và không chạy quảng cáo, đồng thời chỉ ra điểm tổng hợp có thể bỏ sót thế mạnh của model, lấy DeepSeek V4.1 Flash làm ví dụ.
Văn phong Claude Fable 5.1. Phân tích của Arena.ai cho thấy Claude Fable 5.1 dùng ít cụm từ sáo mòn, ít dấu gạch dài và ít lời rào đón hơn Fable 5, với độ dài phản hồi trung vị tăng 30%, dù câu trả lời vẫn ngắn hơn Opus 5.
Toán của GPT-6 Astra. GPT-6 Astra dẫn đầu ErdosBench về các bài toán mở dù OpenAI nói toán không phải ưu tiên, khi giải được 106 trong 226 bài; tuy vậy Fable 5.1 đã lấy lại vị trí dẫn đầu.
Harness đánh giá quan trọng. Người dùng nhận thấy harness hay scaffolding bao quanh một model có thể ảnh hưởng đáng kể đến kết quả benchmark; DeepSeek V4.1 Flash cho thấy rõ khác biệt giữa điểm riêng lẻ và điểm tổng hợp.
Kiểm tra bảo mật bằng AI. Các bản phát hành bảo mật mới nhất của Datasette ra đời từ một đợt audit dùng Claude Fable 5.1, GPT-5.6 và GPT-6 Astra; nhóm phát triển tìm ra những lỗi tinh vi và dự định tiếp tục audit bằng frontier model.
Phát triển theo spec. Một bài viết mới lập luận rằng khi đã có trợ lý lập trình AI, khâu kiểm chứng trở thành nút thắt, và phát triển theo spec chỉ thực sự đáng giá với những bài toán khó, nhiều ràng buộc, nhờ neo việc review vào một bản hợp đồng.
AI tìm kháng sinh. Một nhà nghiên cứu dùng Codex và ChatGPT để quét genome của các sinh vật còn sống và đã tuyệt chủng nhằm tìm phân tử kháng khuẩn, qua đó tăng tốc giai đoạn đầu của quá trình phát triển thuốc.
Công cụ & framework
Cherenkov trên Apple Silicon. Cherenkov là một inference engine cho Apple Silicon, giữ một tập expert với kích thước giới hạn trong bộ nhớ hợp nhất và truyền những expert khác từ SSD, nhờ đó Qwen3.8-Flash-Next chạy được ở tốc độ 8-22 token/giây trên MacBook Air 32GB.
Extension Sol-Pi của Nvidia. Nvidia phát hành Sol-Pi, một extension độc lập cho harness Pi agent, đóng gói các cơ chế tăng hiệu quả nhằm cắt giảm những lượt lặp lại, việc phát lại context, các observation quá lớn và việc đọc log dài.
OpenWiki viết tài liệu. Credit Genie dùng OpenWiki, agent viết tài liệu repo mã nguồn mở của LangChain, để giữ tài liệu codebase luôn mới và cung cấp một cổng tìm kiếm cho cả kỹ sư lẫn coding agent.
Layout tensor GGUF. Một người đăng model đã công bố bản đồ layout theo từng tensor mới cho lượng tử hóa GGUF, với kết quả thử nghiệm cho thấy các shape mới chạy tốt hơn toàn diện so với những bản đăng trước.
Xấp xỉ KV trên Qwen. Một dự án cộng đồng đã tái hiện kỹ thuật prefill KV nhanh của DeepSeek V4.1 Flash trên Qwen, hiện đã có bản demo và đang hướng tới một model 27B.
Đó là tất cả cho hôm nay - khoảng 5 phút đọc.