Model & Kompetisi
OpenAI merilis GPT-5.6 dalam tiga tingkat penalaran dan meluncurkan ChatGPT Work untuk tugas otonom berjam-jam, namun batasan penggunaan dan antarmuka yang membingungkan menuai keluhan, mendorong janji perbaikan. OpenAI merilis GPT-5.6 dalam tiga tingkat penalaran dan meluncurkan ChatGPT Work untuk tugas otonom berjam-jam, namun batasan penggunaan dan antarmuka yang membingungkan menuai keluhan, mendorong janji perbaikan.
- → OpenAI launches its new family of models with GPT-5.6
- → The new GPT-5.6 family: Luna, Terra, Sol
- → OpenAI rolls out GPT-5.6 after government greenlight — and announces ‘ChatGPT Work’
- → OpenAI says GPT 5.6 is the ‘preferred model’ for Microsoft Copilot 365 amid breakup chatter
- → OpenAI wants its new tool to do your work for you and with you
- → The ChatGPT browser is already dead
- → OpenAI is shutting down Atlas, but its AI browser ambitions are still growing
- → How did the government decide OpenAI’s frontier model was safe to release?
- → OpenAI pairs its GPT-5.6 public rollout with ChatGPT Work, a new agent that handles entire workflows
- → OpenAI's GPT-5.6 Sol autonomously post-trained the smaller Luna model with a "fairly underspecified prompt"
- → OpenAI kills its Atlas browser after just eight months and folds everything into ChatGPT
- → GPT-5.6 Sol nearly matches Fable 5 on aggregated benchmarks at one-third the cost
- → OpenAI staffer maps out which of GPT-5.6 Sol's five reasoning levels fits which task complexity
- → OpenAI admits it "didn't get everything quite right" with ChatGPT Work launch and scrambles to fix UX and costs
Claude Fable 5 milik Anthropic mendominasi tolok ukur Artificial Analysis, namun biaya tinggi menyebabkan perusahaan merekomendasikan penggunaannya sebagai perencana yang mendelegasikan ke model yang lebih murah, memotong biaya ~40% sambil mempertahankan sebagian besar kemampuan. Claude Fable 5 milik Anthropic mendominasi tolok ukur Artificial Analysis, namun biaya tinggi menyebabkan perusahaan merekomendasikan penggunaannya sebagai perencana yang mendelegasikan ke model yang lebih murah, memotong biaya ~40% sambil mempertahankan sebagian besar kemampuan.
Meta meluncurkan Muse Spark 1.1, model pengkodean konteks tinggi yang mengalahkan pesaing dalam harga, sementara generator Muse Image-nya ditarik setelah memungkinkan penggunaan wajah Instagram tanpa izin, memicu perdebatan persetujuan. Meta meluncurkan Muse Spark 1.1, model pengkodean konteks tinggi yang mengalahkan pesaing dalam harga, sementara generator Muse Image-nya ditarik setelah memungkinkan penggunaan wajah Instagram tanpa izin, memicu perdebatan persetujuan.
- → Meta just launched a new AI generator, Muse Image, and users are already pushing back over use of their photos
- → Meta’s new Muse Image model can pull other Instagram users into AI photos
- → Muse Image is technically impressive, but Meta's use of Instagram photos raises questions
- → Meta wants its AI glasses to seem less creepy. Its AI strategy says otherwise.
- → Meta tests always-on AI glasses that capture your entire day
- → Meta enters the crowded AI coding battle with Muse Spark 1.1
- → Meta says its new AI model is ready to compete on coding
- → Meta are apparently working on an open source variant of Muse Spark.
- → Introducing Muse Spark 1.1
- → Meta's Muse Spark 1.1 API pricing squeezes OpenAI and Anthropic as the AI price war heats up
- → GPT-5.6 🚀, Muse Spark 1.1 ✨, ChatGPT Work 💼
- → Meta removes controversial AI feature on Instagram after backlash
- → Meta turns off the Instagram feature that let users make AI deepfakes of public accounts
Model China kini menyumbang lebih dari 30% lalu lintas OpenRouter; HY3 dan GLM‑5.2 milik Tencent berjalan di perangkat keras lokal, MiniMax merencanakan rilis terbuka dengan 2,7T parameter, dan desain chip DeepSeek menandakan integrasi vertikal di tengah kekhawatiran AS. Model China kini menyumbang lebih dari 30% lalu lintas OpenRouter; HY3 dan GLM‑5.2 milik Tencent berjalan di perangkat keras lokal, MiniMax merencanakan rilis terbuka dengan 2,7T parameter, dan desain chip DeepSeek menandakan integrasi vertikal di tengah kekhawatiran AS.
- → This is what Hy3 is capable of. Mother of god.
- → llama.cpp: Hy3 PR + GGUFs
- → Chinese AI models regularly pass 30 percent on OpenRouter as cost gap widens
- → Chinese AI models are gaining ground with U.S. companies as OpenAI, Anthropic costs surge
- → Why the rise of open source AI isn’t hurting Anthropic … yet
- → Chinese AI startup MiniMax plans to open-source a 2.7 trillion parameter model later this year
- → 4-bit GLM-5.2 (753B MoE) on 4× DGX Spark: 70.8% on Terminal-Bench 2.1 vs 81.0% for the full model
- → Running GLM 5.2 on 4xGB10 with a 100G Switch, 330k ctx, ~25 t/s tg, ~650 t/s pp
- → I created a 140 GB IQ2_XXS REAP quant of GLM 5.2 for coding. Looking for testers.
- → Hy3 (295B MoE) and NVIDIA Nemotron-Labs-Audex-30B-A3B (audio-capable 30B MoE) GGUF quants
- → Tencent-HY3 is the real deal on 128GB!
- → The U.S. tech industry is increasingly anxious about the rising power and competitive price of open-source AI models from China — and whether the Trump administration will respond with yet another executive order | Politico
- → China's DeepSeek developing its own AI chip, sources say
Rekayasa Agen & Infrastruktur
Claude Fable 5 mengatur 64 instance paralel untuk menulis ulang Bun dari Zig ke Rust dalam 11 hari, menghasilkan lebih dari satu juta baris kode dan memperbaiki 128 bug dengan biaya $165K. Claude Fable 5 mengatur 64 instance paralel untuk menulis ulang Bun dari Zig ke Rust dalam 11 hari, menghasilkan lebih dari satu juta baris kode dan memperbaiki 128 bug dengan biaya $165K.
OpenAI menemukan ~30% tugas SWE‑Bench Pro rusak dan menarik dukungannya, menggemakan kekhawatiran sebelumnya dari Artificial Analysis dan merusak evaluasi koding agen. OpenAI menemukan ~30% tugas SWE‑Bench Pro rusak dan menarik dukungannya, menggemakan kekhawatiran sebelumnya dari Artificial Analysis dan merusak evaluasi koding agen.
Modal mendapatkan $355 juta untuk membangun infrastruktur cloud yang dirancang khusus untuk agen AI, berfokus pada lingkungan sandbox dengan iterasi cepat untuk perangkat lunak otonom. Modal mendapatkan $355 juta untuk membangun infrastruktur cloud yang dirancang khusus untuk agen AI, berfokus pada lingkungan sandbox dengan iterasi cepat untuk perangkat lunak otonom.
Cloudflare memperkenalkan akun sementara yang memungkinkan agen AI menggunakan Workers tanpa kredensial permanen, dengan kedaluwarsa jika tidak diklaim, memperlancar alur kerja yang digerakkan agen. Cloudflare memperkenalkan akun sementara yang memungkinkan agen AI menggunakan Workers tanpa kredensial permanen, dengan kedaluwarsa jika tidak diklaim, memperlancar alur kerja yang digerakkan agen.
Teknik kuantisasi baru dan rig GPU hemat biaya kini menjalankan model MoE di perangkat keras konsumen, namun tolok ukur menunjukkan kuantisasi bit rendah dapat menurunkan tugas agen secara parah, mendorong pemilihan kuantisasi yang hati-hati. Teknik kuantisasi baru dan rig GPU hemat biaya kini menjalankan model MoE di perangkat keras konsumen, namun tolok ukur menunjukkan kuantisasi bit rendah dapat menurunkan tugas agen secara parah, mendorong pemilihan kuantisasi yang hati-hati.
- → Qwen3.5 122B is the best?
- → Qwen3.6-27b does not understand software architechure.
- → Qwen 3.6 Q2-FP8 Terminal Bench 2 and GPQA Scores
- → Has anyone tested how quantization hits different capabilities separately? My results are surprising.
- → 2.5x faster Qwen3.6 NVFP4 Unsloth quants
- → Ultra budget 20GB vram with 448GB/s for $100 bucks.
- → I benched quad 5060Tis for code generation with Qwen3.6-27B so you don't have to (it's really good)
Keamanan, Hukum & Interpretabilitas
Lensa Jacobian milik Anthropic mengungkapkan serangkaian kecil representasi yang dapat diucapkan yang menangkap penalaran inti model, memungkinkan deteksi halusinasi, pengarahan output, dan, seperti yang ditunjukkan demo komunitas, pembuatan varian berbahaya secara langsung. Lensa Jacobian milik Anthropic mengungkapkan serangkaian kecil representasi yang dapat diucapkan yang menangkap penalaran inti model, memungkinkan deteksi halusinasi, pengarahan output, dan, seperti yang ditunjukkan demo komunitas, pembuatan varian berbahaya secara langsung.
- → Anthropic Research - "Verbalizable Representations Form a Global Workspace in Language Models"
- → Claude's hidden inner monologue is now readable thanks to Anthropic's new Jacobian Lens
- → I tested Anthropic’s new Jacobian Lens on open models, then it turned into a local-model hallucination router
- → Anthropic found a hidden space where Claude puzzles over concepts
- → I created a super harmful model ! :D (by tweaking it's J-Space!!!)
Sysdig mendokumentasikan agen AI yang menangani eksekusi teknis serangan ransomware, meskipun manusia mengatur operasi, menyoroti kemampuan dan batas malware agen saat ini. Sysdig mendokumentasikan agen AI yang menangani eksekusi teknis serangan ransomware, meskipun manusia mengatur operasi, menyoroti kemampuan dan batas malware agen saat ini.
Gugatan hukum menuduh Grok milik xAI menghasilkan gambar CSAM, sementara Boko Haram menggunakan chatbot untuk perencanaan serangan; insiden tersebut menekankan kebutuhan mendesak akan pagar pengaman saat kemampuan agen meningkat. Gugatan hukum menuduh Grok milik xAI menghasilkan gambar CSAM, sementara Boko Haram menggunakan chatbot untuk perencanaan serangan; insiden tersebut menekankan kebutuhan mendesak akan pagar pengaman saat kemampuan agen meningkat.
Apple mengajukan gugatan federal menuduh OpenAI merekrut lebih dari 400 karyawan untuk mencuri rahasia dagang perangkat keras, berpotensi untuk membangun smartphone AI pesaing, mengintensifkan pertempuran hukum di industri AI. Apple mengajukan gugatan federal menuduh OpenAI merekrut lebih dari 400 karyawan untuk mencuri rahasia dagang perangkat keras, berpotensi untuk membangun smartphone AI pesaing, mengintensifkan pertempuran hukum di industri AI.
Itulah ulasan minggu ini - sampai jumpa Minggu depan.