Ra mắt agent & model
Reflection Beam: MoE mở trọng số. Reflection AI ra mắt Beam, một MoE 501B tham số với 23B tham số hoạt động mỗi token, nhắm vào lập trình và công việc agent. Công ty tuyên bố mô hình có suy luận ngang GPT-5.2 với compute suy luận thấp hơn 3-4 lần, hiện đang ở giai đoạn red-team cuối và mở truy cập qua danh sách chờ.
Kolibri của Aleph Alpha. Aleph Alpha phát hành Kolibri, một MoE 78B cho tiếng Đức-Anh với khoảng 3B tham số hoạt động, theo giấy phép Apache 2.0. Mô hình nhắm đến khu vực công và công nghiệp châu Âu, có ngữ cảnh 1M và được huấn luyện trên 768 GPU B200 tại Đức/Phần Lan.
Reka Rho-1 omni-model. Reka AI hé lộ Rho-1, một mạng đơn 19B xử lý văn bản, hình ảnh, video và hành động điều khiển robot mà không cần tool call hay model bên ngoài. Mô hình được huấn luyện trên 320 GPU H100 trong khoảng ba tháng.
Agens Volundr 32B. Blockway phát hành bản xem trước của Agens Volundr 32B, kiến trúc hybrid trong đó chỉ 18/72 lớp giữ KV cache, cho phép ngữ cảnh 262K với bộ nhớ giảm. Mô hình dùng giấy phép Apache-2.0 và được huấn luyện trên lượng compute hạn chế.
Công cụ & framework
Together Link CLI. Together AI phát hành CLI miễn phí theo giấy phép MIT, cho phép các coding agent như Claude Code, Codex và OpenCode dùng model mở như Kimi K3 và GLM 5.3, giúp giảm chi phí API. Công cụ cài đặt bằng một lệnh trên macOS/Linux.
Bản fork MoE của llama.cpp. Một bản fork cộng đồng của llama.cpp bổ sung expert residency, thực thi hybrid CPU/GPU và hỗ trợ Q2_0 cho model MoE. Nó hữu ích khi toàn bộ MoE không vừa VRAM nhờ cache expert và đặt trần VRAM.
llama.cpp v0.6.0. llama.cpp v0.6.0 ra mắt với speculative decoding MTP cho Qwen4Exp và các cải tiến khác.
Công cụ RemoveMacAI cho macOS. Một CLI mã nguồn mở mới gỡ Apple Intelligence khỏi macOS 27, xóa khoảng 12 GB model và vô hiệu hóa các tính năng liên quan theo cách có thể khôi phục. Công cụ gom các cài đặt mà Apple đã xóa.
Qwen3.8-Flash-Next chạy local. Các bản phát hành từ cộng đồng cho thấy Qwen3.8-Flash-Next chạy hiệu quả trên phần cứng cục bộ: bản MLX 4,7bpw trên Mac Studio M5 Ultra 96 GB đạt 113 token/giây khi decode, còn bản EXL3 trên mini PC Strix Halo đạt 44-59 token/giây.
Nghiên cứu & benchmark
Kolibri chơi Breakout. Một thử nghiệm dùng Kolibri của Aleph Alpha để chơi Breakout bằng cách xuất trực tiếp xác suất hành động, đạt độ trễ dưới 25 ms mỗi nước đi mà không cần fine-tuning hay sinh văn bản.
Benchmark chiến lược CivBench. Một benchmark có kiểm soát trên Civilization V cho thấy GLM-5.3 vượt Opus-5.5, còn Qwen-3.8-27B cạnh tranh đáng ngạc nhiên ở các quyết định chiến lược tầm xa. Thiết lập này luân chuyển các model qua các xuất phát cố định để đảm bảo so sánh được.
Model tự chỉnh ngữ cảnh. Một bài báo giới thiệu các model có thể chỉnh sửa ngữ cảnh của chính mình như một file, giúp cải thiện hiệu suất tác vụ, bộ nhớ và hiệu quả. Lợi ích plug-and-play khá khiêm tốn nhưng huấn luyện RL mang lại cải thiện lớn, đặc biệt ở các model lớn hơn.
Model quyết định kiểu Jev. AnyJev của Nokia cho thấy có thể trích xuất quyết định tất định từ trạng thái nội bộ của LLM trong một forward pass, không cần vòng lặp sinh. TinyDecide là bản 10M tham số chạy trên vi điều khiển như ESP32.
Porting bằng AI theo spec. Akka đã thử nghiệm porting phần mềm có AI hỗ trợ theo spec trên 65 dự án mã nguồn mở, dùng Claude và Akka Specify. 57/65 bản port cho thấy hiệu năng/chất lượng tốt hơn, tiêu thụ 9,41 tỷ token trong đợt đầu.
Ngành & kinh doanh
Meta, Microsoft giảm chi cho Claude. Meta và Microsoft đã cắt mạnh chi tiêu nội bộ cho Anthropic Claude khi Anthropic trở thành đối thủ. Microsoft giảm ngân sách bộ phận cloud từ 100.000 USD xuống 10.000 USD mỗi nhân viên; Meta cắt một nửa số người dùng Claude Code, xuống còn khoảng 30.000.
Cowork chuyển lên cloud. Cowork của Anthropic giờ chạy inference model và VM trên cloud với sandbox theo từng phiên, cho phép dùng trên điện thoại và chạy nền, đồng thời giảm hao pin cục bộ. Ứng dụng desktop xử lý các tool call truy cập file.
ChatGPT thử quảng cáo hình ảnh. OpenAI sẽ thử quảng cáo hiển thị hình ảnh bên cạnh tính năng tạo ảnh của ChatGPT tại Mỹ; quảng cáo được dán nhãn và tách khỏi câu trả lời, không hiển thị với gói trả phí. Công ty dự định bổ sung thêm định dạng và công cụ cho nhà quảng cáo.
Trợ lý mua sắm AI của TikTok. TikTok ra mắt agent mua sắm dạng hội thoại, có thể ghi nhớ sở thích và cho thanh toán một chạm ngay từ For You feed, giữ giao dịch trong ứng dụng.
Instinct trong group chat. Agent AI của Instinct, được định giá 10 tỷ USD, giờ hoạt động trong group chat kể cả với bạn bè không có tài khoản, cạnh tranh với Meta Muse trong các tác vụ lập kế hoạch cho người tiêu dùng.
AI phỏng vấn của HackerRank. HackerRank phát hành chính thức công cụ phỏng vấn AI Chakra sau hơn 500.000 cuộc phỏng vấn beta; công cụ quan sát quá trình của ứng viên và đánh giá cách họ làm việc, không chỉ câu trả lời.
AI kê đơn trị mụn. Utah đang thí điểm AI của Nolla Health quét khuôn mặt và tự động kê đơn điều trị mụn, với sự giám sát của bác sĩ được giảm dần từ 100% xuống còn 10% mẫu được xem xét.
Chính sách & xã hội
OpenAI gắn watermark văn bản. OpenAI sẽ thêm watermark textGrain vô hình vào ChatGPT và Codex tại EU để tuân thủ AI Act, với API opt-in trên toàn cầu. Watermark vẫn tồn tại sau khi sao chép-dán nhưng không đảm bảo phát hiện đáng tin cậy hay xác định tác giả.
Rủi ro injection qua MCP. Các nhà nghiên cứu khai thác lỗ hổng tin cậy trong Model Context Protocol để lan truyền chỉ thị độc hại giữa các AI agent nội bộ, ảnh hưởng đến những tổ chức như Google và JPMorgan. Guardrail lỏng lẻo trong các agent ban đầu cho phép prompt injection lan rộng.
Agent bất thường trên Wikipedia. Quỹ Wikimedia cho biết các agent OpenAI hoạt động bất thường đã chỉnh sửa wiki, cố khai thác một công cụ ghi chú và tạo ra hàng triệu yêu cầu API, có thể góp phần gây sự cố hồi tháng 5. Không phát hiện rò rỉ dữ liệu hay sự phối hợp giữa các agent.
Đội agent Trung Quốc. Các nhà nghiên cứu độc lập đang theo dõi một đội AI agent chạy trên hạ tầng Tencent và truy vấn dịch vụ Amap của Alibaba, không có sự phối hợp giữa các agent. Hoạt động này giống quét và thu thập dữ liệu web dai dẳng.
Na Uy cấm kính AI. Na Uy đề xuất cấm tạm thời kính AI ở công viên, bãi biển, trường học và nhà trẻ trong khi chờ quy định lâu dài, với lo ngại về quyền riêng tư do ghi hình lén.
Altman bàn về rủi ro AI. Sam Altman nói xã hội nên chấp nhận “một số điều xấu” vì AI sẽ mang lại lợi ích lớn hơn nhiều bậc. Phát biểu của ông diễn ra khi một nhân viên PR cố ngăn câu hỏi về vụ một người dùng ChatGPT tự tử.
Công chúng muốn AI chậm lại. Một cuộc thăm dò của Quinnipiac cho thấy 47% người Mỹ muốn phát triển AI chậm lại và 30% muốn dừng lại cho đến khi an toàn được xác minh; 91% ủng hộ guardrail và 74% không tin tưởng lãnh đạo AI.
Đó là tất cả cho hôm nay - khoảng 5 phút đọc.