Phát hành Mô hình & Hạ tầng
Mô hình ưu tiên tốc độ của Nvidia. Nvidia đã phát hành Nemotron 3.5 Lightning, mô hình Mamba-Transformer 30B trọng số mở, đạt kết quả tương đương GPT-OSS-120B trên các benchmark trong khi được tối ưu hóa cho suy luận nhanh với chỉ 3.6B tham số hoạt động.
DeepSeek V4 Chạy Cục bộ. Các phiên bản lượng tử hóa cộng đồng của DeepSeek V4 khắc phục các vấn đề chuyển đổi cho các đường cơ sở chính xác bit, và DeepSeek V4 Flash đạt hơn 27 t/s trên APU Strix Halo với giải mã suy đoán, cho thấy khả năng triển khai cục bộ khả thi.
Ứng dụng Desktop Unsloth. Unsloth đã phát hành ứng dụng desktop mã nguồn mở để chạy và huấn luyện các mô hình cục bộ trên GPU, với tính năng thực thi mã trong môi trường sandbox, RAG, xuất mô hình và không có telemetry.
Vòng hạt giống 1.1 tỷ USD của River AI. Được thành lập bởi đồng sáng lập xAI trước đây Igor Babuschkin, River AI đã huy động được 1.1 tỷ USD để xây dựng các trợ lý AI có thể huấn luyện riêng cho cá nhân bằng cách thiết kế lại toàn bộ ngăn xếp từ huấn luyện đến phần cứng.
Daybreak Cyber trên AWS. Các mô hình an ninh mạng Daybreak của OpenAI hiện có sẵn qua Amazon Bedrock, mang lại cho các nhà bảo vệ quyền truy cập vào các khả năng an ninh mạng tiên tiến trong môi trường AWS hiện có của họ.
Tuyên ngôn mã nguồn mở của Zuck. CEO của Meta kêu gọi phát hành nhiều mô hình trọng số mở hơn và mời các chính phủ hợp tác trong việc kiểm thử an toàn, khi công ty tiếp tục công bố các mô hình như Muse Glimmer.
Hỗ trợ Ling‑3.0. Một yêu cầu kéo (pull request) thêm Ling‑3.0 vào llama.cpp, với một biến thể nhỏ đã hoạt động tốt cho các tác vụ giọng nói của trợ lý gia đình nhờ khả năng từ chối trung thực khi không chắc chắn.
Công cụ & AI cục bộ
MCP Broker Cắt Giảm Ngữ cảnh. Một bộ khung agent tự làm (DIY) sử dụng MCP broker để ẩn các công cụ phía sau proxy, giảm ngữ cảnh khởi động từ 20K token xuống gần như bằng không, đồng thời thêm nhận thức về thời gian để thực thi cục bộ tốt hơn.
GPU Khai thác cho LLM. Các thẻ khai thác CMP170HX 8GB có thể được mở rộng lên 64GB mỗi thẻ, chạy các mô hình lớn hoặc nhiều mô hình nhỏ đồng thời, mang lại hiệu năng rẻ nhưng đã cũ thuộc phân khúc Ampere.
366 t/s trên V100. Các kernel CUDA tùy chỉnh (v100‑skinny) cho phép đạt tới 366 t/s trên Qwen3.6 27B ở định dạng NVFP4 trên GPU Volta, thổi sức sống mới vào phần cứng cũ cho suy luận cục bộ.
Mô hình TinyTitle. Một mô hình GRU 1.8 triệu tham số tạo tiêu đề cuộc trò chuyện trong dưới 5 MiB RAM, chứng minh khả năng tóm tắt siêu nhẹ trên thiết bị chạy trong vài mili giây.
AI Riêng tư cho Máy đọc sách. Một ứng dụng máy đọc sách tích hợp các mô hình Gemma 4B cục bộ để hỏi đáp về sách một cách riêng tư, với nút bật/tắt spoiler và tự động khớp ngôn ngữ.
Máy chủ AI Công suất thấp. Một dàn máy kết hợp Intel N100 với RTX 5060Ti tạo ra máy chủ llama.cpp yên tĩnh và hiệu quả, có khả năng chạy các mô hình gần đây như Qwen 3.5 để sử dụng hàng ngày.
Giảm Mạnh Chi phí Suy luận. CEO của Doubleword giải thích cách thiết kế các ngăn xếp suy luận cho mục đích không theo thời gian thực có thể cắt giảm chi phí token hơn một bậc độ lớn so với các thiết lập đa năng.
Định tuyến Mô hình Thông minh. Thư viện Switchyard của NVIDIA chỉ định tuyến 7% cuộc gọi agent đến một mô hình tiên tiến, giảm chi phí 74% với mức giảm độ chính xác tối thiểu, và cung cấp công thức để đánh giá chi phí‑lợi ích.
Kính AR Riêng tư. Một người dùng khiếm thị yêu cầu kính AR kiểu Meta chạy các mô hình cục bộ để tránh gửi dữ liệu hình ảnh đến Meta, nhấn mạnh nhu cầu bảo mật trong công nghệ hỗ trợ.
Nghiên cứu tiên phong
AI Đối mặt với Riemann. Một mô hình chưa phát hành của Anthropic đã đạt được tiến bộ trên giả thuyết Riemann bằng cách thử nghiệm 650 ý tưởng với 60 trợ lý con trong 36 giờ, làm dấy lên lại cuộc tranh luận về vai trò của AI trong khám phá toán học.
Chẩn đoán Video của AMIE. Hệ thống nghiên cứu AMIE của Google đã chứng minh khả năng tư vấn lâm sàng qua video ở cấp độ chuyên gia, sử dụng Gemini và cấu hình đa agent để giải thích các tín hiệu thị giác, thính giác và ngữ cảnh.
AI X-quang Ngực CARE‑X. CARE‑X của Microsoft là một VLM X-quang ngực thống nhất kết hợp sinh tạo và dự đoán có cấu trúc, sử dụng học tăng cường để khen thưởng độ chính xác lâm sàng.
Cuộc đối đầu Bộ nhớ Agentic. ACE và ALTK‑Evolve đều biến các quỹ đạo agent thành các bài học tái sử dụng; ACE xây dựng một sổ tay chiến lược toàn diện, trong khi ALTK‑Evolve truy xuất các hướng dẫn riêng lẻ.
Logprobs Phát hiện Ảo giác. Phân tích phân bố xác suất token tại thời điểm hồi tưởng sự kiện đầu tiên trong chuỗi suy nghĩ (chain‑of‑thought) có thể tiết lộ kiến thức không đáng tin cậy, cung cấp một tín hiệu sớm tiềm năng về ảo giác.
Cảnh báo về Viết bằng AI. S. Alpert lập luận rằng không có sự viết lại nào là không mất mát, vì vậy văn bản được hỗ trợ bởi AI phải được cá nhân xác minh để tránh làm sai lệch ý nghĩa dự định của tác giả.
Kinh doanh & Tài chính
Cột mốc 1 tỷ người dùng. ChatGPT và Gemini đều đạt 1 tỷ người dùng hoạt động hàng tháng, trong đó Gemini là sản phẩm nhanh nhất của Google đạt quy mô đó; ChatGPT đã đạt 900 triệu người dùng hàng tuần vào đầu năm nay.
Quảng cáo ChatGPT Vươn Ra Toàn cầu. OpenAI đã mở rộng quảng cáo ChatGPT đến năm quốc gia nữa, báo cáo không có tác động đến niềm tin của người dùng và tỷ lệ đóng quảng cáo thấp khi tìm kiếm cách kiếm tiền bền vững.
OpenAI Tăng Giá. Các ghế ChatGPT Business Premium mới có giá 125 USD/người dùng/tháng với công suất gấp năm lần và không có giới hạn hàng giờ, phản ánh việc sử dụng token lớn của các khối lượng công việc agentic.
Lightcap Rời đi. Brad Lightcap, cựu COO và trưởng dự án đặc biệt của OpenAI, sẽ rời đi sau tám năm để bắt đầu một điều gì đó mới, tiếp nối chuỗi các sự ra đi của giám đốc điều hành.
Hợp đồng thuê 9.1 tỷ USD của Anthropic. Anthropic đã ký thỏa thuận trung tâm dữ liệu trị giá 9,1 tỷ USD trong 20 năm với công ty khai thác Bitcoin Riot Platforms cho 191 MW tại Texas, dự kiến cung cấp năng lượng cho thế hệ mô hình tiếp theo bắt đầu từ năm 2027.
Rào cản IPO của Anthropic. Trước nguy cơ IPO 965 tỷ USD, các nhà đầu tư đặt câu hỏi về sự tăng trưởng của Anthropic giữa bối cảnh mô hình Trung Quốc giá rẻ và những trở ngại chính trị, mặc dù công ty quảng bá các ứng dụng sức khỏe và sinh học trong tương lai.
Nỗ lực 500 tỷ USD của Nvidia. Nvidia hợp tác với sáu công ty tài chính để huy động 500 tỷ USD cho cơ sở hạ tầng AI bằng cách bảo đảm tới 25% giá trị còn lại của chip, chống lại nỗi lo khấu hao.
Cược AI Ấn Độ của Accel. Accel đã chốt quỹ Ấn Độ trị giá 550 triệu USD được đăng ký vượt mức, đặt cược rằng AI sẽ củng cố các startup tiêu dùng, fintech và sản xuất thay vì là một hạng mục độc lập.
Rút tiền của Nhân viên OpenAI. Chương trình mua lại cổ phiếu trị giá 7 tỷ USD ở mức định giá 852 tỷ USD cho phép nhân viên hiện tại và cựu nhân viên OpenAI thanh lý cổ phiếu, giảm bớt áp lực trước nguy cơ IPO.
Bảo mật & Minh bạch
EU Bắt buộc Đánh dấu AI. Theo Đạo luật AI của EU, Anthropic và OpenAI cam kết đánh dấu nội dung được tạo ra; Claude sẽ nhúng các hình mờ vô hình trong văn bản và hình ảnh, hỗ trợ cho các mô hình cũ đang được phát triển.
Nguồn gốc Ảnh Apple. iOS 27 có thể giới thiệu 'Apple Reference Image' để nhúng siêu dữ liệu nguồn gốc khi chụp, cho phép người dùng chứng minh ảnh iPhone không phải là deepfake.
Spotify Gắn cờ Nghệ sĩ AI. Spotify sẽ gắn nhãn hồ sơ nghệ sĩ do AI tạo ra và loại trừ chúng khỏi các đề xuất, sử dụng cả tự khai báo và phát hiện trước khi triển khai thay đổi vào giữa tháng 9.
Tranh cãi về Viết AI. Hãng game Saber phủ nhận việc thay thế các nhà văn bằng ChatGPT cho Rideshare Stimulator, nhưng cựu biên kịch chính khẳng định AI đã được sử dụng cho văn bản và giọng nói, mà không khai báo trên Steam.
Khai thác Zoom bằng AI. Một lỗ hổng nghiêm trọng của Zoom cho phép chiếm quyền điều khiển thiết bị qua tính năng chú thích đã được tìm thấy chỉ với chưa đầy 20 lời nhắc cho các mô hình AI công khai, cho thấy nghiên cứu bảo mật được tăng tốc bằng AI.
Đánh cắp dấu vết suy luận. Các nhà nghiên cứu đã phát lại các token chuỗi suy nghĩ được mã hóa từ các mô hình tiên tiến vào các phiên bản anh em yếu hơn, vượt rào và thu hồi các suy luận ẩn, làm lộ mật khẩu và khóa API trong các phiên công khai.
Tin tưởng Mã AI Tạo ra. IBM và Red Hat mở rộng Lightwell để tạo ra các chuỗi cung ứng phần mềm có thể xác minh cho kỷ nguyên AI, đảm bảo nguồn gốc và tuân thủ chính sách cho cả mã do con người và AI tạo ra.
Đó là tất cả cho hôm nay - khoảng 5 phút đọc.