Rilis Model
Qwen 3.8 27B. Tim Qwen dari Alibaba merilis Qwen3.8-27B dan Qwen3.8-2.4T-A95B yang lebih besar di bawah lisensi Apache 2.0. Model dense 27B berbagi arsitektur yang sama dengan Qwen3.6-27B tetapi meningkatkan coding, tugas perkantoran, dan perencanaan agen melalui perubahan pelatihan. Model ini mendukung konteks native 262k, yang dapat diperluas hingga 1 juta token.
GLM-5.3 dari Zhipu. Zhipu AI merilis GLM-5.3, yang menggunakan model dasar yang sama dengan GLM-5.2 tetapi dengan post-training yang diperluas. Perusahaan mengklaim model ini adalah model coding open-weights terkuat, dengan peningkatan signifikan dalam coding agentik dan penemuan kerentanan keamanan siber. Bobot (weights) diharapkan tersedia di Hugging Face dalam dua minggu.
Muse Glimmer dari Meta. Meta membuka sumber Muse Glimmer, model agentik 30B di bawah Apache 2.0 yang ditujukan untuk alur kerja lokal pada GPU konsumen. Model ini menyuling keterampilan penalaran dan pemanggilan alat dari Muse Spark yang lebih besar dan sempat menjadi frontier di kelas 30B.
Gelombang model open China. Dalam kurang dari sebulan, laboratorium China telah merilis Kimi K3, Qwen3.8, DeepSeek-V4-Pro-0813, dan GLM-5.3, menggarisbawahi kemajuan frontier open-weight yang pesat.
Deployment Lokal & Komunitas
Percepatan Apple Silicon. Rilis mlx-dspark baru membawa decoding spekulatif ke Qwen3.8-27B di Apple Silicon, mencapai generasi hingga sekitar 3× lebih cepat pada M4 Pro sambil menghasilkan token output yang identik.
Kuantisasi dan bobot. Unsloth merilis bobot terkuantisasi Qwen3.8-27B, dan Tim Dettmers menggoda metode kuantisasi baru yang dapat menjalankan GLM-5.3 pada satu DGX Spark dengan kecepatan 7 token/s.
Tes awal Qwen 3.8. Tes komunitas menunjukkan demo coding one-shot yang kuat dan perilaku agentik pada Qwen3.8-27B, tetapi sebagian pengguna melaporkan pengetahuan umum yang terpotong secara signifikan dan jejak pemikiran yang sangat panjang pada upaya penalaran xhigh. Parameter sampling yang direkomendasikan tersedia di kartu model.
- → Qwen 3.8 - 27B is a game changer
- → A hunch: Qwen3.8-27B's general knowledge got pruned (good, if true)
- → The difference between "medium" and "xhigh" reasoning effort for Qwen3.8-27B is actually insane.
- → Qwen 3.8 27B - Aquarium Burst Sample Test
- → RetroCraft - Qwen 3.8 27B Q8, one shot with exact performance data on dual 3090s.
Varian lokal tanpa sensor. Versi 'heretic' komunitas dari Qwen3.8-27B menghilangkan penolakan dan pengaman, bertujuan menyediakan alternatif lokal tanpa sensor pada tingkat model frontier seperti Opus 4.6.
Transparansi & Keamanan AI
Deteksi watermark Anthropic. Anthropic akan menawarkan API deteksi watermark sehingga pengembang pihak ketiga dapat mendeteksi teks yang kemungkinan dihasilkan oleh Claude. Metode ini menggunakan SynthID Text dan kurang dapat diandalkan pada teks pendek, padat fakta, atau yang ditulis ulang secara ekstensif.
Google membuat watermark opsional. Google mengizinkan pengguna untuk mematikan watermark yang terlihat pada gambar, video, dan musik yang dihasilkan AI dari Nano Banana, Omni, dan Lyria. SynthID tak terlihat dan metadata C2PA akan tetap disematkan untuk verifikasi.
Injeksi prompt di pengadilan. Seorang hakim Connecticut mendokumentasikan apa yang tampaknya menjadi pengajuan pengadilan AS pertama dengan teks tersembunyi yang dimaksudkan untuk memanipulasi sistem AI yang meninjau kasus tersebut. Instruksi tersembunyi itu tidak berpengaruh, tetapi hakim menyebut taktik itu berbahaya.
Agen dalam Produksi
Tugas pemeliharaan Claude Code. Anthropic mengatakan Claude Code telah menjalankan pemeliharaan harian pada aplikasinya sendiri, membuat 388 pull request dengan tingkat penggabungan 46 persen setelah tinjauan manusia. Rutinitas mencakup fuzzing crash, pembersihan abstraksi duplikat, dan pemeriksaan dependensi.
OpenAI Computer History. Computer History dari OpenAI menggantikan prototipe screenshot Chronicle, merekam klik, ketukan tombol, dan perpindahan aplikasi di macOS untuk membangun garis waktu yang dapat dicari. Ini dapat mendeteksi alur kerja yang berulang dan menyarankan keterampilan yang dapat digunakan kembali untuk ChatGPT dan Codex.
Industri & Bisnis
Perang harga AS-China. OpenAI dan Anthropic memangkas harga seiring model open China semakin berkembang; Gemini 3.7 Flash dari Google debut dengan potongan harga pengantar 50 persen yang ditujukan untuk coding dan agen. Harga token dari laboratorium AS terkemuka telah turun hampir seperempat sejak pertengahan Juli.
GPT-5.6 Sol Ultrafast. OpenAI meluncurkan pratinjau mode Ultrafast untuk GPT-5.6 Sol yang didukung oleh Cerebras, menghasilkan hingga 750 token output per detik. Layanan API awalnya terbatas untuk pelanggan tertentu dan ditujukan untuk analisis real-time selama insiden atau peristiwa pasar.
AI Meta untuk semua orang. Meta menggabungkan rilis Glimmer dengan surat panjang Zuckerberg yang berargumen bahwa AI harus terbuka untuk semua orang, tetapi liputan podcast mencatat bahwa perusahaan menyimpan Muse Spark paling kuat di balik API. Diskusi yang sama menyoroti akuisisi senilai $250 juta yang salah.
Model China Apple-Alibaba. Apple dilaporkan melatih model AI khusus untuk pasar China dengan bantuan Alibaba, sebelum menghadirkan Apple Intelligence ke perangkat China. Kemitraan ini adalah kolaborasi AI AS-China yang langka.
Dorongan inferensi Kog. Startup Prancis Kog menggunakan optimasi perangkat lunak untuk mengeluarkan lebih banyak kecepatan dari GPU konvensional seperti AMD MI300X dan Nvidia H200, menargetkan decoding permintaan tunggal yang lebih cepat untuk beban kerja rekayasa perangkat lunak.
Risiko harga gas alam. Prakiraan baru Noreva memperingatkan bahwa harga gas alam bisa tiga kali lipat di sebagian AS karena hyperscaler seperti Amazon, Google, Meta, dan Microsoft mengunci daya gas untuk pusat data AI.
Sorotan Penelitian
Model ARC 150M. Model penalaran laten berulang dengan 150M parameter mencetak 29,5% pada ARC-AGI-1 dengan biaya $0,0007 per tugas, di luar frontier biaya-akurasi yang dipublikasikan. Model ini berjalan pada perangkat keras minimal, meskipun penskalaan hingga miliaran parameter masih diperlukan.
Keraguan riset otonom. Studi Princeton dan AISI Inggris menggunakan makalah NeurIPS yang belum dipublikasikan menemukan bahwa model frontier saat ini menangani rekayasa penelitian tetapi gagal pada bagian penelitian yang penting, bertentangan dengan klaim lab tentang riset AI otonom.
Evolusi harness DarwinX. DarwinX mengembangkan harness agen melalui seleksi alam atas prompt, alat, keterampilan, dan alur kontrol, menjaga bobot model tetap beku. Ini menambah sekitar 17 poin rata-rata di empat benchmark dan mentransfer tanpa perubahan ke SWE-bench Verified.
Benchmark PlayWorld. PlayWorld melakukan benchmark model dunia video menggunakan pemain agen multimodal yang mengejar 171 tujuan jangka panjang, mengukur konsistensi geometri, fidelitas interaksi, evolusi di luar pandangan, dan evolusi wawasan.
Itu saja untuk hari ini - sekitar bacaan 5 menit.