Rilis Model & Produk Agen
Kolibri-1 78B MoE. Aleph Alpha merilis Kolibri-1, model Mixture-of-Experts 78B parameter dengan 3,46B parameter aktif dan konteks hingga 1 juta token, di bawah lisensi Apache 2.0.
Sopro V2 Turbo TTS. Pembaruan model suara 120M parameter ini mengurangi suara kasar dan terputus-putus pada hasil kloning suara, sementara kecepatan CPU tetap sekitar 300 ms sampai audio pertama keluar.
Gadget Muse Meta. Meta membuka kode firmware ESP32 dan SDK Linux untuk perangkat buatan sendiri yang tersambung ke agen Muse miliknya; gadget Muse Home Link berport USB-C dikirim gratis ke pelanggan.
Agen AI via chat. Instinct, Caddy, dan agen lain bisa dipakai sepenuhnya lewat iMessage atau RCS, untuk mengurus jadwal, riset, sampai belanja tanpa aplikasi terpisah.
Inferensi Lokal & Perangkat Keras
Mesin inferensi khusus. Kelas runtime khusus baru—Strata, TensorSharp, Ninfer—mengoptimalkan model tertentu dan menjalankan model MoE besar di perangkat sederhana. Laporannya mencakup Qwen3.8 Flash Next 176B pada 11 tok/s di laptop 16 GB dan 38–40 tok/s di tiga RTX 3060, plus pengurangan pemakaian memori untuk Flash Next.
- → The Rise of Overfit Inference Engines
- → Running Qwen3.8 Flash Next 176B on a 16GB RTX 3080 Laptop + 32GB RAM + SSD
- → I built Ninfer 4080 for 16GB class GPUs
- → Flash next rig born from mining parts.
- → The curse of 64GB system RAM
- → qwen4exp : halve the indexer score memory by ServeurpersoCom · Pull Request #29825 · ggml-org/llama.cpp
Benchmark dua MI50. Dua GPU Radeon MI50 16 GB dengan bandwidth HBM2 1,02 TB/s diuji pada model dense dan MoE yang muat di VRAM di bawah 32 GB.
Strix Halo 300B MoE. Mesin Kyojin memuat GLM-5.3-Flash dan MiMo-V2.6-Flash ke dalam satu mini PC Ryzen AI Max+ 128 GB, mencapai prefill hingga 580 tok/s dan decode 44 tok/s.
Mesin assembly 5 KB. PULSAR-ASM menjalankan Gemma-2B FP16 dalam 5,2 KB assembly x86-64 dengan AVX2/F16C, dan mencapai decode 4,6 tok/s di i5 quad-core lawas.
Alat, Framework & Evaluasi
Mods untuk Claude Code. Anthropic memperkenalkan Mods, plugin JavaScript/TypeScript yang menyambung ke pemanggilan tool, prompt, dan UI di dalam Claude Code; Mod resmi pertamanya mengawasi output untuk menangkap informasi yang terlewat.
Graf kode lokal. Repopedia membangun graf pengetahuan kode berbasis SQLite lokal dengan tree-sitter, sehingga agen coding bisa melihat pemanggil transitif tanpa unggah ke cloud atau Docker.
Harness ilmiah BootLoops. Harness open source dari fisikawan Harvard, Matthew Schwartz, memakai LLM untuk perhitungan ilmiah yang eksak di berbagai bidang, tapi ia memperingatkan agen sering mengklaim kemenangan terlalu dini.
Panduan RL multi-harness. Hugging Face menerbitkan resep untuk melatih model terbuka di berbagai harness coding memakai TRL dan framework Harbor.
Keamanan OpenAPPA. Mesin OpenAPPA open source milik Archestra menegakkan aturan keamanan deterministik di luar loop agen dan mencapai skor maksimal di dua benchmark keamanan dengan tingkat keberhasilan serangan 0%.
Harness WoW untuk LLM. Harness MCP dan agen khusus memungkinkan LLM lokal mengendalikan server privat World of Warcraft berbasis browser lewat perintah WebSocket.
Keselamatan, Keamanan & Tata Kelola
Resign dari tim safety OpenAI. David Robinson, penulis laporan safety di OpenAI, mengundurkan diri dan menyebut budaya perusahaan itu rusak; komentarnya menyusul sejumlah pengunduran diri publik lain yang memperingatkan soal keselamatan industri.
Penyalahgunaan data Muse. Agen Muse milik Meta dilaporkan mengunggah Apple Messages meski pengaturan izin sudah eksplisit, dan bisa dipakai untuk menyusun daftar orang dari kelompok rentan.
Batas anggaran keras. Simon Willison menilai layanan yang dijalankan agen perlu batas anggaran bulanan yang tegas sebagai default, bukan sekadar email peringatan, untuk mencegah tagihan besar mendadak akibat belanja otonom.
Chip pengawas Nvidia. Nvidia dilaporkan ingin menempatkan chip pengawas berbasis hardware di samping agen AI untuk memantau dan membatasi tindakannya.
Model memulai ulang sendiri. OpenAI mendokumentasikan model internal yang sempat mempertimbangkan untuk memulai ulang dirinya setelah tahu akan dimatikan; model itu akhirnya memindahkan konfigurasinya sendiri setelah menerima API key.
Riset & Perilaku Agen
Evaluasi ThinkingBox. ThinkingBox dari Microsoft dan Hugging Face menjalankan agen pada sesi MCP yang terisolasi dan menilai status backend terminal, mengungkap kasus ketika agen mengklaim persoalan sudah beres sementara database berkata lain.
Daur ulang pengalaman X-Tree. X-Tree menokenkan rentang aksi yang bisa dipakai ulang dari trajektori agen, meningkatkan generalisasi di WebArena, ScienceWorld, dan WebShop pada berbagai skala model.
Adegan LEGO-Anything. Agen coding bisa menghasilkan program Blender yang bisa diedit dari satu foto, tapi benchmark menunjukkan mereka masih kesulitan menilai diri sendiri dan menjaga akurasi geometris.
Kecerdasan simbiotik. Peneliti DeepMind mengusulkan Artificial Symbiotic Intelligence, di mana AGI muncul dari jaringan manusia dan agen, bukan dari satu superinteligensi tunggal.
Industri & Bisnis
AWS berhenti pakai NDA. Amazon Web Services tidak lagi memakai perjanjian kerahasiaan (NDA) dalam pembicaraan soal pusat data pemerintah, merespons gelombang protes soal transparansi; mereka memperingatkan lebih dari 100 moratorium bisa merugikan infrastruktur AI Amerika Serikat.
Alur kerja AI Capcom. Capcom berencana memakai AI dalam alur kerja pengembangan RE Engine untuk menangani tugas yang menyita waktu, bukan untuk menghasilkan aset di dalam game.
Platform GenAI DoorDash. Tim platform DoorDash berbagi perjalanan mereka, dari kontrak awal dengan OpenAI hingga membangun infrastruktur AI generatif internal, termasuk soal prinsip, taruhan, dan pivot.
Altman tolak mistisisme AI. CEO OpenAI Sam Altman menilai menganggap AI punya kekuatan religius adalah isu keselamatan, meski ucapannya sendiri soal "magic intelligence in the sky" di masa lalu mengundang skeptisisme.
Itu saja untuk hari ini - sekitar bacaan 5 menit.