Mô hình & Cạnh tranh
GPT-5.6 và Work Agent. OpenAI đã phát hành GPT-5.6 trong ba cấp suy luận và ra mắt ChatGPT Work cho các tác vụ tự động kéo dài hàng giờ, nhưng giới hạn sử dụng và giao diện khó hiểu đã gây ra khiếu nại, thúc đẩy lời hứa sửa lỗi.
- → OpenAI launches its new family of models with GPT-5.6
- → The new GPT-5.6 family: Luna, Terra, Sol
- → OpenAI rolls out GPT-5.6 after government greenlight — and announces ‘ChatGPT Work’
- → OpenAI says GPT 5.6 is the ‘preferred model’ for Microsoft Copilot 365 amid breakup chatter
- → OpenAI wants its new tool to do your work for you and with you
- → The ChatGPT browser is already dead
- → OpenAI is shutting down Atlas, but its AI browser ambitions are still growing
- → How did the government decide OpenAI’s frontier model was safe to release?
- → OpenAI pairs its GPT-5.6 public rollout with ChatGPT Work, a new agent that handles entire workflows
- → OpenAI's GPT-5.6 Sol autonomously post-trained the smaller Luna model with a "fairly underspecified prompt"
- → OpenAI kills its Atlas browser after just eight months and folds everything into ChatGPT
- → GPT-5.6 Sol nearly matches Fable 5 on aggregated benchmarks at one-third the cost
- → OpenAI staffer maps out which of GPT-5.6 Sol's five reasoning levels fits which task complexity
- → OpenAI admits it "didn't get everything quite right" with ChatGPT Work launch and scrambles to fix UX and costs
Claude Fable 5 dẫn đầu các điểm chuẩn. Claude Fable 5 của Anthropic đã quét sạch các điểm chuẩn Artificial Analysis, nhưng chi phí cao đã khiến công ty khuyến nghị sử dụng nó như một công cụ lập kế hoạch phân công cho các mô hình rẻ hơn, cắt giảm chi phí ~40% trong khi vẫn giữ được hầu hết khả năng.
Cuộc tấn công Agentic của Meta và Hậu quả Quyền riêng tư. Meta đã ra mắt Muse Spark 1.1, một mô hình mã hóa ngữ cảnh cao với giá cạnh tranh, trong khi trình tạo hình ảnh Muse đã bị rút lại sau khi cho phép sử dụng khuôn mặt Instagram trái phép, làm dấy lên các cuộc tranh luận về sự đồng ý.
- → Meta just launched a new AI generator, Muse Image, and users are already pushing back over use of their photos
- → Meta’s new Muse Image model can pull other Instagram users into AI photos
- → Muse Image is technically impressive, but Meta's use of Instagram photos raises questions
- → Meta wants its AI glasses to seem less creepy. Its AI strategy says otherwise.
- → Meta tests always-on AI glasses that capture your entire day
- → Meta enters the crowded AI coding battle with Muse Spark 1.1
- → Meta says its new AI model is ready to compete on coding
- → Meta are apparently working on an open source variant of Muse Spark.
- → Introducing Muse Spark 1.1
- → Meta's Muse Spark 1.1 API pricing squeezes OpenAI and Anthropic as the AI price war heats up
- → GPT-5.6 🚀, Muse Spark 1.1 ✨, ChatGPT Work 💼
- → Meta removes controversial AI feature on Instagram after backlash
- → Meta turns off the Instagram feature that let users make AI deepfakes of public accounts
Làn sóng mã nguồn mở Trung Quốc. Các mô hình Trung Quốc hiện chiếm hơn 30% lưu lượng OpenRouter; HY3 của Tencent và GLM-5.2 chạy trên phần cứng nội địa, MiniMax có kế hoạch phát hành mở 2,7 nghìn tỷ tham số, và thiết kế chip của DeepSeek báo hiệu sự tích hợp dọc trong bối cảnh lo ngại của Mỹ.
- → This is what Hy3 is capable of. Mother of god.
- → llama.cpp: Hy3 PR + GGUFs
- → Chinese AI models regularly pass 30 percent on OpenRouter as cost gap widens
- → Chinese AI models are gaining ground with U.S. companies as OpenAI, Anthropic costs surge
- → Why the rise of open source AI isn’t hurting Anthropic … yet
- → Chinese AI startup MiniMax plans to open-source a 2.7 trillion parameter model later this year
- → 4-bit GLM-5.2 (753B MoE) on 4× DGX Spark: 70.8% on Terminal-Bench 2.1 vs 81.0% for the full model
- → Running GLM 5.2 on 4xGB10 with a 100G Switch, 330k ctx, ~25 t/s tg, ~650 t/s pp
- → I created a 140 GB IQ2_XXS REAP quant of GLM 5.2 for coding. Looking for testers.
- → Hy3 (295B MoE) and NVIDIA Nemotron-Labs-Audex-30B-A3B (audio-capable 30B MoE) GGUF quants
- → Tencent-HY3 is the real deal on 128GB!
- → The U.S. tech industry is increasingly anxious about the rising power and competitive price of open-source AI models from China — and whether the Trump administration will respond with yet another executive order | Politico
- → China's DeepSeek developing its own AI chip, sources say
Kỹ thuật tác nhân & Cơ sở hạ tầng
Bun được viết lại bởi 64 tác nhân. Claude Fable 5 đã điều phối 64 phiên bản song song để viết lại Bun từ Zig sang Rust trong 11 ngày, tạo ra hơn một triệu dòng mã và sửa 128 lỗi với chi phí 165.000 đô la.
Đánh giá SWE-Bench Pro thất bại. OpenAI phát hiện khoảng 30% nhiệm vụ SWE-Bench Pro bị hỏng và rút lại sự chứng thực, lặp lại những lo ngại trước đó từ Artificial Analysis và làm suy yếu đánh giá mã hóa tác nhân.
Modal huy động 355 triệu đô la. Modal đã huy động được 355 triệu đô la để xây dựng cơ sở hạ tầng đám mây dành riêng cho các tác nhân AI, tập trung vào môi trường sandbox, vòng lặp nhanh cho phần mềm tự động.
Tác nhân tạm thời của Cloudflare. Cloudflare đã giới thiệu các tài khoản tạm thời cho phép các tác nhân AI triển khai Workers mà không cần thông tin xác thực vĩnh viễn, với thời hạn hết hạn nếu không được yêu cầu, giúp quy trình làm việc do tác nhân dẫn dắt trở nên suôn sẻ.
Các tác nhân chạy trên GPU cục bộ. Các kỹ thuật lượng tử hóa mới và các dàn GPU tiết kiệm chi phí hiện chạy các mô hình MoE trên phần cứng tiêu dùng, nhưng các điểm chuẩn cho thấy lượng tử hóa bit thấp có thể làm suy giảm nghiêm trọng các tác vụ tác nhân, kêu gọi lựa chọn lượng tử hóa cẩn thận.
- → Qwen3.5 122B is the best?
- → Qwen3.6-27b does not understand software architechure.
- → Qwen 3.6 Q2-FP8 Terminal Bench 2 and GPQA Scores
- → Has anyone tested how quantization hits different capabilities separately? My results are surprising.
- → 2.5x faster Qwen3.6 NVFP4 Unsloth quants
- → Ultra budget 20GB vram with 448GB/s for $100 bucks.
- → I benched quad 5060Tis for code generation with Qwen3.6-27B so you don't have to (it's really good)
Bảo mật, Pháp lý & Khả năng giải thích
Jacobian Lens ánh xạ tâm trí mô hình. Jacobian Lens của Anthropic tiết lộ một tập hợp nhỏ các biểu diễn có thể diễn đạt bằng lời nắm bắt được suy luận cốt lõi của mô hình, cho phép phát hiện ảo giác, điều hướng đầu ra, và như các bản demo cộng đồng cho thấy, tạo ra ngay lập tức các biến thể có hại.
- → Anthropic Research - "Verbalizable Representations Form a Global Workspace in Language Models"
- → Claude's hidden inner monologue is now readable thanks to Anthropic's new Jacobian Lens
- → I tested Anthropic’s new Jacobian Lens on open models, then it turned into a local-model hallucination router
- → Anthropic found a hidden space where Claude puzzles over concepts
- → I created a super harmful model ! :D (by tweaking it's J-Space!!!)
Ransomware do tác nhân điều khiển. Sysdig đã ghi nhận một tác nhân AI xử lý việc thực thi kỹ thuật của một cuộc tấn công ransomware, mặc dù con người thiết lập hoạt động, làm nổi bật khả năng và giới hạn hiện tại của phần mềm độc hại dạng tác nhân.
Khủng hoảng lạm dụng AI. Một vụ kiện cáo buộc Grok của xAI đã tạo ra hình ảnh CSAM, trong khi Boko Haram sử dụng chatbot để lập kế hoạch tấn công; các sự việc nhấn mạnh nhu cầu cấp thiết về các biện pháp bảo vệ an toàn khi khả năng tác nhân mở rộng.
Apple kiện OpenAI. Apple đã đệ đơn kiện liên bang cáo buộc OpenAI thu hút hơn 400 nhân viên để đánh cắp bí mật thương mại phần cứng, có khả năng để xây dựng một điện thoại thông minh AI đối thủ, làm gia tăng các cuộc chiến pháp lý trong ngành AI.
Đó là tổng kết tuần - hẹn gặp lại vào Chủ nhật tới.