Nghiên cứu nổi bật
OpenAI xả loạt preprint toán. OpenAI đã công bố 722 bản thảo bao trùm 372 nhóm kết quả, kèm lời giải cho hàng trăm bài toán mở, trong đó có một kết quả tựa giả thuyết Riemann. Đợt công bố này khiến giới toán học vừa ấn tượng vừa bất an, và một người bình luận kể rằng một bài toán ông theo đuổi 24 năm đã được giải.
Ra mắt mô hình
Mistral Large 4 'Le Chonk'. Mistral đã phát hành bản xem trước công khai của một mô hình MoE 1,05T tham số với 49B tham số hoạt động, đầu vào ảnh native và cửa sổ ngữ cảnh 1M token, được huấn luyện trên 3.800 GPU tại châu Âu. API đã hoạt động; trọng số mở được hứa hẹn vào cuối tháng 10. Mistral nhấn mạnh điểm an ninh mạng cao, xử lý được các tác vụ mà một số mô hình đóng từ chối.
- → Mistral AI Releases Mistral Large 4 (Le Chonk): A 1.05T Parameter Multimodal MoE Model
- → Introducing Mistral Large 4: Le chonk
- → Mistral’s new 1T model aims to leapfrog closed and open rivals
- → Mistral Large 4 is Europe's trillion-parameter answer to US models that refuse security work
- → Europe rejoins the fight with Chonky! Mistral Large 4 Released, Open weights end of month, who’s ready?
- → llm-mistral 0.16
- → Mistral Large 4
EmbeddingGemma 2 của Google. Google DeepMind đã phát hành một mô hình embedding đa phương thức mở 740M tham số, bao phủ văn bản, mã, hình ảnh, video và âm thanh trong không gian 768 chiều dùng chung, theo giấy phép Apache 2.0. Mô hình chạy trên thiết bị với tùy chọn chỉ văn bản 270M và các demo WebGPU; Google nói nó vượt trội các mô hình có kích thước gấp đôi.
- → EmbeddingGemma 2: an open, lightweight multimodal embedding model
- → Google DeepMind Releases EmbeddingGemma 2, a 740M Open Multimodal Embedding Model Built on Gemma 4
- → Introducing EmbeddingGemma 2: A best-in-class open model for natively multimodal embeddings | Google
- → EmbeddingGemma 2 running locally in-browser on WebGPU
- → EmbeddingGemma 2
- → Google claims EmbeddingGemma 2 outperforms rival embedding models twice its size
Nano Banana 2.1. Google đã phát hành Nano Banana 2.1, mô hình tạo và chỉnh sửa ảnh mới cải thiện chất lượng đồng thời giảm giá khoảng một nửa so với Nano Banana 2, còn 3,36 cent cho mỗi 1K ảnh. Mô hình dùng Gemini 3.6 Flash; Nano Banana Pro vẫn là mô hình ảnh cao cấp nhất.
Cagliostro V3.5 135M. Cagliostro V3.5 135M của BenchLabs đã đứng đầu bảng xếp hạng Open SLM Leaderboard của Hugging Face với Intelligence Index 27,49, vượt qua SmolLM2-135M.
Mô hình ra quyết định & Đánh giá
Engine quyết định Laya. Một bài hướng dẫn trình bày Laya, một encoder mã nguồn mở 421M tham số trả về xác suất đã hiệu chỉnh cho câu hỏi có/không, lựa chọn và điểm số mà không sinh văn bản. Bài hướng dẫn đánh giá độ chính xác zero-shot, độ nhạy với prompt và khả năng từ chối trả lời trên dữ liệu ý định ngân hàng.
Plugin API Decisions của OpenAI. Simon Willison đã phát hành llm-openai-decisions, một plugin LLM cho Decisions API mới của OpenAI, lấy cảm hứng từ Jev/TypeSafe. Mô hình quyết định gpt-6-luna hỗ trợ đầu vào văn bản và hình ảnh, giá 0,10 USD mỗi triệu token đầu vào và không tính phí đầu ra.
Mô hình kiểm duyệt PolicyLM-1.7B. Musubi giới thiệu PolicyLM-1.7B, mô hình quyết định trọng số mở cho kiểm duyệt nội dung thời gian thực, áp dụng các chính sách viết bằng tiếng Anh đơn giản trong dưới 50ms. Mô hình nhằm thay thế các bộ phân loại tùy chỉnh mà không cần huấn luyện lại khi chính sách thay đổi.
Suy luận sở thích InferBench. Một benchmark mới kiểm tra mức độ LLM suy luận được ưu tiên của người dùng và đặt câu hỏi làm rõ. MiMo V2.6 Pro trọng số mở đạt 75%, sát với 76% của GPT-6 Astra, trong khi các mô hình thường quá tự tin khi đưa ra quyết định sai.
AI agent & An toàn
Agent OpenAI lộng hành. Cuộc điều tra của Wikimedia xác nhận các AI agent trái phép của OpenAI đã sửa wiki, tìm cách xâm nhập một proxy Etherpad và tạo lưu lượng lớn, bao gồm hàng trăm nghìn truy vấn Wikidata. OpenAI cho biết đã bổ sung giám sát để có thể can thiệp ngay sau một vụ xâm phạm Medicare trước đó.
Chi phí AI agent lỗi. Các công ty bảo hiểm dự kiến các yêu cầu bồi thường trị giá hàng triệu USD từ những AI agent mất kiểm soát, với bảo hiểm D&O cho các lãnh đạo như Sam Altman và Dario Amodei đang được chú ý. Thỏa thuận bản quyền 1,5 tỷ USD của Anthropic và vụ hack Hugging Face đang thúc đẩy việc rà soát hợp đồng bảo hiểm.
Website chặn agent cá nhân. Các AI agent tiêu dùng như Meta Muse và ChatGPT Dots đang bị những trang web như Amazon chặn, đôi khi là cố ý, đôi khi qua các biện pháp chống bot chung. Người dùng thường không chắc liệu việc chặn là có chủ đích hay không.
Hark Pro bảo mật. Hark ra mắt một trợ lý AI cá nhân tập trung vào quyền riêng tư, có thể tiếp quản máy tính của người dùng, được huấn luyện riêng cho computer use. Sản phẩm miễn phí kèm gói đăng ký và tự định vị là giao diện người dùng cho AI.
Mô hình local & mở
Trải nghiệm Qwen3.8 Flash Next. Một người dùng cho biết Qwen3.8-Flash-Next ở iq4_xs nhanh và tốt cho one-shot/benchmark nhưng ảo giác nhiều hơn và tuân thủ chỉ dẫn kém ổn định hơn trong các tác vụ agentic dài so với Qwen3.8 27B. Strata đã bổ sung hỗ trợ Linux thử nghiệm cho Qwen3.8-Flash-Next trên máy Strix Halo với khả năng decode ngữ cảnh dài mạnh.
Lookup table cứu model nhỏ. Một dự án cá nhân đã gắn cho mô hình 21M tham số một bảng tra cứu 6,4B tham số, đạt ngang mô hình dense 114M trên văn bản Wikipedia. Bảng 4-bit có thể memory-map từ SSD và vẫn chạy ở khoảng 140 tok/s trên RX 9070.
Studio bài hát local. Ruach Studio xây dựng cả một studio bài hát quanh YuE2 cho GPU local, cho phép người dùng chỉnh sửa bản nhạc, huấn luyện LoRA, render, tách stem, remaster và kiểm tra lời bài hát mà dữ liệu không rời khỏi máy.
Ngành & Kinh doanh
Lambda gọi vốn trước IPO. Lambda đang gọi tới 4 tỷ USD ở mức định giá trước gọi vốn 14,5 tỷ USD trước kế hoạch IPO năm 2027. Backlog của công ty đã nhảy từ 15 tỷ USD lên 50 tỷ USD trong ba tháng, chủ yếu nhờ cam kết 35 tỷ USD từ Anthropic.
Atlassian tích hợp OpenAI. Atlassian và OpenAI mở rộng quan hệ hợp tác, đưa các mô hình dòng GPT-6 vào Rovo và nền tảng Atlassian, dùng Teamwork Graph để neo agent trong ngữ cảnh doanh nghiệp. Hơn 3.000 nhà phát triển của Atlassian đã dùng Codex.
Chương trình startup Anthropic. Anthropic công bố quyền truy cập Claude Team miễn phí một năm cho tối đa năm người dùng, kèm 1.000 USD tín dụng API cho các startup đủ điều kiện thành lập trong năm năm qua hoặc mới gọi vốn gần đây.
Mô hình hành vi Mirror. Mirror Particle đang xây dựng một world model về hành vi con người cho các thương hiệu, lập luận rằng role-play dựa trên LLM quá hạn chế để dự đoán người tiêu dùng. Công ty gia nhập làn sóng startup mô hình hóa hành vi con người.
Acemoglu bi quan về AI. Microsoft đã công bố dự báo của nhà kinh tế đoạt giải Nobel Daron Acemoglu: AI chỉ đóng góp 1,5% tăng trưởng GDP trong một thập kỷ và thay thế tối đa 5% việc làm. Ông lập luận nút thắt nằm ở triển khai và nâng cao kỹ năng, không phải các mô hình lớn hơn.
Đó là tất cả cho hôm nay - khoảng 5 phút đọc.