Mô hình quyết định & đầu ra có cấu trúc
Jev và các model quyết định. TypeSafe AI ra mắt Jev, một model chỉ chuyên đưa ra quyết định và trả về xác suất có kiểu. Chỉ vài ngày sau, AWS, Cloudflare và Perplexity lần lượt tung ra model quyết định mở của riêng mình. Thực ra, structured output và ràng buộc grammar hiện có vốn đã cho phép sinh văn bản ràng buộc theo cách tương tự.
- → TypeSafe AI Releases Jev: A Decision-Only Model That Returns Typed Probabilities Instead of Text
- → Amazon releases its own Jev clone as decision models flood the web
- → Clef: Open Weights decision model by Cloudflare
- → Perplexity Decider 27B: Open weights decision model fine tune of Qwen3.8 27B
- → Guys... OpenAI API on VLLM and Llamacpp already supported grammar enforcer... (AKA JEV)
LoRA quyết định chạy local. Jeff-Qwen3.5-0.8B cùng chín bộ LoRA adapter xử lý những quyết định lặp lại của agent như phát hiện prompt injection hay chọn công cụ, nhanh hơn 38 lần và độ chính xác tăng 8,7, chỉ tốn thêm chưa đến 2 GB bộ nhớ.
Agent & sản phẩm ra mắt
OpenAI Dots đối đầu Meta Muse. OpenAI công bố Dots, một agent dễ thương chạy trên GPT-6 Astra, có thể dựng thế giới ảo, nhưng chỉ nằm trong gói 1 USD/tháng và phải đối đầu với Muse miễn phí của Meta.
Shopify ra mắt Canvas. Shopify ra mắt Canvas, cho phép người bán dựng cửa hàng bằng cách trò chuyện với AI Sidekick, với khả năng render mã thật theo thời gian thực.
ChatGPT thử đồ ảo. OpenAI bổ sung tính năng thử đồ ảo và lưu yêu thích vào ChatGPT shopping, dùng model Images 2.5 để mô phỏng quần áo trên ảnh của người dùng.
Avatar Tavus Griffin. Tavus giới thiệu Griffin, model avatar video thời gian thực. Trong một cuộc gọi dài một phút, 48% người tham gia thử nghiệm tưởng nhầm đó là người thật.
Đám tang app di động. Photon tổ chức đám tang cho ứng dụng di động và huy động được 4,5 triệu USD để giúp lập trình viên xây agent nhắn tin trên iMessage/WhatsApp.
Mô hình mở & AI local
Gemini 4 Argon. Google DeepMind giới thiệu Gemini 4 Argon với các benchmark đạt mức SOTA và tối đa 1 triệu token đầu ra, nhưng ban đầu chỉ mở cho bản xem trước trong lĩnh vực an ninh mạng.
Dàn model mở K2 Horizon. IFM phát hành K2 Horizon, sáu model mở từ 0,9B đến 375B tham số, kèm dữ liệu huấn luyện, mã nguồn và log; đội ngũ cũng có buổi AMA về phát triển mở.
MTP cho Qwen Flash Next. llama.cpp đã merge hỗ trợ multi-token prediction cho Qwen Flash Next, giúp tăng tốc suy luận.
Slipstream trên Mac. Slipstream, engine suy luận trên Metal, chạy được Qwen3.8-Flash-Next 95,5 GiB trên máy Mac 64 GB với tốc độ 41-52 token/giây, nhanh hơn llama.cpp 1,76 lần và giữ được ngữ cảnh dài ổn định.
Olmo-core 3. Allen AI phát hành Olmo-core 3, hạ tầng huấn luyện mở, có thể mở rộng cho các model MoE nghìn tỷ tham số.
Nghiên cứu & benchmark
Ataraxos hạ Stratego. Nhóm nghiên cứu CMU/MIT/NYU/Stanford xây dựng Ataraxos, đánh bại kỳ thủ Stratego giỏi nhất với tỷ số 15-1 cùng 4 ván hòa, chấm dứt thế thống trị của con người; chi phí huấn luyện dưới 8.000 USD.
Agentic RAG thắng thế. Benchmark 18 pipeline RAG so với một agent loop trên FRAMES: pipeline tốt nhất đạt 78,9%, agent loop đạt 92,7%, cho thấy agent truy xuất vượt trội so với pipeline cố định.
AutoSynthData. ServiceNow CoreAI xây dựng AutoSynthData để sinh dữ liệu huấn luyện từ những lần model thất bại và những ca thành công của model thầy, giúp cải thiện agent doanh nghiệp.
Dấu vết văn AI. Graphite tìm ra 13.000 cụm từ là dấu hiệu văn do AI viết; các model Claude đang tiến gần hơn tới phân bố từ ngữ của con người, còn GPT thì ngày càng xa.
Ngành, chính sách & bảo mật
Google thoát kiện chống độc quyền. Tòa bác đơn kiện của Chegg và Penske, vốn cáo buộc AI Overviews của Google làm giảm lưu lượng truy cập một cách bất hợp pháp; các lập luận chống độc quyền không đứng vững.
Grok ảnh hưởng Venezuela. Time đưa tin Trump đã dành nhiều giờ nói chuyện với Grok trước cuộc can thiệp vào Venezuela; Grok dự đoán sẽ có người ăn mừng, càng củng cố quan điểm của Trump.
OpenAI mất nhân sự an toàn. OpenAI chia tay ba nhà nghiên cứu an toàn, với cáo buộc họ chia sẻ thông tin mật cho một tổ chức an toàn bên thứ ba.
Anthropic nhắm khu vực công. Anthropic ra mắt Claude for Government dành cho các cơ quan dân sự, chạy trong môi trường FedRAMP High; lệnh cấm từ Lầu Năm Góc vẫn giữ nguyên trong lúc tranh chấp pháp lý chưa ngã ngũ.
Trung tâm dữ liệu vũ trụ. Google đã phóng một vệ tinh tính toán trên quỹ đạo dạng nguyên mẫu, gắn TPU; Satlyt huy động được 8 triệu USD để xây phần mềm cho AI trên vệ tinh, và muốn đạt quy mô lớn thì vẫn cần tới Starship.
Agent rò rỉ ảnh nội bộ. Glow Security phát hiện hơn 13.000 ảnh chụp màn hình nội bộ do AI agent tải lên các repo GitHub công khai, làm lộ dữ liệu khách hàng và thông tin đăng nhập.
Chiến dịch đánh cắp reasoning. OpenAI cho biết đã chặn được một chiến dịch distillation đối kháng nhắm vào phần reasoning được bảo vệ; thủ thuật tương tự vẫn thành công trên Azure.
Đó là tất cả cho hôm nay - khoảng 5 phút đọc.