Model Lokal & Beban Kerja Agen
Qwen3.8 27B lokal. Uji komunitas menunjukkan Qwen3.8 27B lebih unggul daripada Qwen3.6 dalam mengikuti instruksi dan menangani konteks panjang; satu RTX 5090 menjalankan versi NVFP4 dengan konteks 262K pada 77 token/detik untuk konteks pendek dan 65 token/detik pada 128K.
Decoding spekulatif. DFlash 2 dengan drafter n-gram menghasilkan 2,26x pada prompt LiveCodeBench untuk Qwen3.8 27B dan hingga 4,68x dalam sesi coding panjang; head MTP tetap pada Ornith 35B memangkas waktu eksekusi sepertiga.
Manajemen konteks rekursif. Para pengembang memasangkan agen utama 64K yang cepat dengan sub-agen rekursif dan model kompresor kecil untuk menangani tugas yang jauh lebih panjang tanpa membayar konteks 300K.
Fine-tuning Gemma untuk tool calling. Fine-tune Gemma 4 12B untuk tool calling dan penggunaan CLI meningkatkan penggunaan tool sebesar 2,7x dan menambah percobaan tool-call sebesar 15,7%, menargetkan sistem dengan VRAM 16GB.
Cluster DGX Spark. Klaster DGX Spark 36 node dijalankan sebagai klaster kemampuan agen, membagi node untuk model SOTA, rerank/embedding, video, gambar, dan audio secara bersamaan.
Alat & Framework
llama.cpp 0.2.0. llama.cpp versi 0.2.0 dirilis dengan prebuild dan perubahan upstream terbaru untuk inferensi lokal.
Cloudflare Kitesurf. Kitesurf adalah mesin browser untuk agen yang dibangun di atas WebAssembly/Rust Workers dengan DOM terisolasi per halaman; mendukung CDP sehingga Playwright dan Puppeteer dapat mengendalikannya dengan overhead lebih rendah daripada Chromium penuh.
llm 0.33. llm 0.33 dari Simon Willison menambahkan kunci API per-panggilan untuk model embedding, template yang dapat diulang untuk menggabungkan konfigurasi model dan prompt, serta opsi reasoning_summary untuk model reasoning.
Praktik agen coding. Simon Willison berpendapat bahwa keterampilan kunci untuk coding agent adalah dengan percaya diri memberi instruksi dan memverifikasi perubahan; Linus Torvalds menggambarkan AI yang melakukan pekerjaan mekanis dalam sesi debug yang sulit tetapi perlu didorong setelah berulang kali mengklaim masalah tersebut tidak dapat dipecahkan.
Riset & Metode
Skill sebagai playbook. Dalam 8.135 kali uji coba, skill agen membantu terutama dengan memberikan proses yang andal, bukan fakta; landasan prosedural menyumbang 65,7% dari peningkatan, dan skill gagal saat tugas menyimpang dari proses yang dipelajari.
Model dunia mental. Penelitian baru menambahkan keyakinan dan niat manusia ke world model AI dengan MENTIS; pemodelan plausibilitas fisik, mental, dan sosial secara signifikan meningkatkan prediksi perilaku manusia.
Psikometri benchmark keamanan. Analisis psikometrik terhadap delapan benchmark keamanan menemukan bahwa satu skor menyembunyikan trade-off antara ketatnya penolakan, kejujuran, dan bahaya kontekstual; model dapat meningkatkan skor keamanan dengan pemblokiran berlebihan.
CoT reversibel. Sebuah proposal untuk langkah penalaran yang kira-kira reversibel dengan pemeriksaan konsistensi siklus dan uncomputation dapat menangkap halusinasi dan mengurangi memori KV-cache di LLM edge.
Simulasi segalanya. Latent Space berpendapat bahwa data sintetis, rubrik, dan lingkungan membuat setiap komponen pipeline ML dibuat model, mendekati simulasi manusia dengan 10% lebih buruk tetapi 100x lebih murah dan 10.000x lebih cepat.
Industri & Aplikasi
Inherent Faraday. Startup Inherent, yang didirikan alumni DeepMind, mengatakan agen Faraday-nya mengungguli model Anthropic dan OpenAI dalam mereproduksi temuan ilmiah yang dipublikasikan secara independen, sambil menggunakan sebagian kecil dari ukurannya.
Ulasan AI LinkedIn. LinkedIn membangun platform review kode AI multi-agen yang menjadikan diff dan konvensi codebase sebagai dasar umpan balik untuk mengurangi halusinasi dan komentar low-signal.
Netflix GenRec. Sistem rekomendasi berbasis model bahasa Netflix, GenRec, mengubah perilaku pengguna menjadi teks dan mengungguli mesin fitur buatan manual dalam uji offline dan A/B langsung dengan data yang jauh lebih sedikit.
DoorDash SafeChat. DoorDash merinci SafeChat, sistem keamanan marketplace yang dibangun dalam skala besar, lalu menggantinya dengan arsitektur yang lebih kuat ketika sistem itu mulai bekerja.
Avatar AI di dunia pendidikan. Bootcamp Foundry seharga $699 dari Harvard Business School menggunakan avatar AI HeyGen untuk memberikan umpan balik pada pitch dan rapat dewan; peserta menyukai pengalaman terpandu itu, meskipun instruktur aslinya mengatakan teksnya agak menyeramkan.
Kabar model. Liquid AI sedang menjajaki minat terhadap model LFM 100B, sementara model misterius bernama Ox Alpha menarik perhatian berkat performa coding dan agentic yang kuat, dengan spekulasi mengarah ke turunan keluarga GLM.
Kebijakan, Keamanan & Kepercayaan
OpenAI SB 53. OpenAI kini mengatakan California harus mengamandemen SB 53 untuk menambahkan pemantauan selama pelatihan frontier dan keamanan siber yang lebih kuat, setelah sebelumnya menentang RUU tersebut.
Rencana pengendalian. Sebuah studi Guidelight menilai lima lab frontier pada containment model liar; OpenAI mendapat skor tertinggi, Anthropic dan Meta terendah, dan hanya sedikit lab yang memublikasikan rencana respons yang telah didemonstrasikan.
Watermarking Claude. Watermarking baru Anthropic untuk keluaran teks Claude dijelaskan secara rinci, mencakup bagaimana watermark diterapkan dan apa yang bisa dan tidak bisa dilakukannya.
Kepercayaan model tertutup. Sebuah thread Reddit r/LocalLLaMA berargumen bahwa OpenAI melakukan sandbagging pada pekerjaan sekolah dan bergeser dari pemberdayaan pengguna, mendorong praktisi kembali ke model lokal untuk loop agentic.
Itu saja untuk hari ini - sekitar bacaan 5 menit.