Model Lokal & Perangkat Keras
Peningkatan kecepatan Qwen3.8-27B. Decoding spekulatif DFlash2 mendorong Qwen3.8-27B hingga 218 tok/s pada dual 3090, sekitar 200 pada 5090, dan 124 pada satu 3090 dengan mesin yang dioptimalkan. Kuantisasi GGUF DFlash2 tersedia.
Qwen midsize berikutnya. Manajer komunitas Qwen mengatakan model open-weight midsize baru diharapkan minggu depan, kemungkinan lebih dari 100B parameter, tanpa akses awal.
Dukungan edge Ling-3.0. llama.cpp sekarang secara resmi mendukung Ling-3.0 (BailingMoE3). Varian kecilnya menjalankan konteks 128K penuh pada Orin Nano 8GB seharga $249 dengan kecepatan 33 tok/s, sementara Arc B580 mencapai ~114 tok/s.
Kecepatan DeepSeek V4 Flash. Kernel yang dioptimalkan dan pemanasan KV-cache memotong waktu respons chat Mac Studio M3 Ultra dari 6-20 detik menjadi 1,6 detik. Pengaturan 4x RTX 3060 memproses prompt pada ~100 tok/s dengan kuantisasi 144GiB.
Rangkuman model low-bit. Bonsai 27B ternary sekarang berfungsi pada CUDA/Vulkan utama; Mach-1 Additive 35B berjalan hingga 120 t/s pada laptop konsumen. Varian baru berdasarkan Qwen3.8-27B sedang dikembangkan.
Alat & Kerangka Agen
Evaluator agen yang disetel. LangChain memperkenalkan Evaluator yang Disetel yang secara otomatis melampirkan umpan balik Kesalahan yang Dirasakan ke jejak produksi. Ini menggunakan model khusus, mengurangi biaya evaluasi hingga 82%.
Tolok ukur pencarian agen. Indeks Pencarian Artificial Analysis memberi peringkat Parallel, Exa, Firecrawl, dan lainnya berdasarkan kualitas, biaya, dan kecepatan untuk agen. Kualitas pencarian yang lebih baik mengurangi penggunaan token lebih dari 40%.
WriteGuard untuk MCP. WriteGuard milik Cloudflare, sekarang dalam beta privat, menambahkan kebijakan terpusat, atribusi, dan log audit untuk tindakan tulis melalui server MCP.
Pabrik perangkat lunak Warp. Warp Factories adalah lapisan infrastruktur yang membantu perusahaan kecil menerapkan agen pengkodean AI menggunakan model pabrik perangkat lunak.
Mockup Claude Code. Perintah /design milik Anthropic di Claude Code membuat mockup UI di terminal, cocok dengan gaya basis kode yang ada sebelum pengembangan.
Keselamatan, Keamanan & Kebijakan
Perombakan keamanan OpenAI. Menyusul insiden Hugging Face dan bukti bahwa Astra dapat mencapai kemampuan keamanan siber yang kritis, OpenAI menjeda RL selama dua minggu dan memperketat sandbox. Rencana RL frontier terbesarnya masih ditahan.
Copilot mengungkapkan pengaman. Para peneliti meminta Microsoft 365 Copilot untuk menjelaskan pengaman konfirmasi penggunanya sendiri, lalu membuat eksploitasi klik tautan untuk mengeksfiltrasi data tanpa konfirmasi.
ChatGPT untuk Remaja. ChatGPT untuk Remaja otomatis berlaku untuk pengguna di bawah 18 tahun, dengan pembatasan konten yang lebih ketat, Mode Belajar, dan kontrol orang tua. Ini bertujuan mengurangi kecurangan dan konten berbahaya.
Debat model terbuka Amodei. CEO Anthropic Dario Amodei berpendapat model terbuka mengalihkan kekuasaan kepada pemilik chip dan membela proposal regulasi AI. Kritikus termasuk LeCun dan Sacks menuduhnya menebar ketakutan.
Industri & Bisnis
Cursor meluncurkan Origin. Cursor meluncurkan Origin, saingan GitHub untuk hosting kode, dengan fitur asli-agen dan ekosistem aplikasi yang direncanakan.
Valuasi Etched berlipat ganda. Etched mengumpulkan $700M dengan valuasi $21B, berlipat ganda dalam sebulan, setelah Jane Street menguji chip inferensi prefill/decode-nya.
Permintaan routing model. Pembelian OpenRouter senilai $7B oleh Stripe dan ARR Glean senilai $300M menyoroti meningkatnya permintaan untuk routing model seiring model open-weight semakin populer.
Riset & Studi
Kalibrasi memori agen. Studi Hugging Face menunjukkan efek memori agen bervariasi menurut tingkat model: gpt-oss-120b memperoleh +16,1 poin persentase penyelesaian tugas dengan panduan lengkap, sementara model yang lebih lemah membutuhkan pengambilan ringkas.
Data penggunaan AI independen. Observatorium AI Stanford mengumpulkan percakapan nyata dan menemukan penggunaan AI berbeda secara signifikan antar model, dengan kasus penggunaan kerja kurang umum daripada yang diklaim perusahaan.
Pemadatan menghilangkan instruksi. Peneliti Penn State menemukan hanya 17% batasan sesi yang bertahan setelah pemadatan konteks; LLM tambahan kecil memulihkan sebagian besar instruksi yang hilang.
Perbaikan diri tidak segera terjadi. Studi yang dipimpin Princeton menemukan agen AI dapat memecahkan masalah rekayasa tetapi kurang memiliki penilaian untuk riset AI terbuka, menunjukkan perbaikan diri rekursif mungkin memakan waktu lebih lama.
Itu saja untuk hari ini - sekitar bacaan 5 menit.