Sorotan Riset
OpenAI borong preprint matematika. OpenAI menerbitkan 722 manuskrip yang mencakup 372 kelompok hasil, lengkap dengan solusi untuk ratusan soal matematika terbuka, termasuk hasil quasi-Hipotesis Riemann. Rilis ini membuat para matematikawan kagum sekaligus gelisah, dan seorang komentator bercerita soal yang ia garap 24 tahun akhirnya terpecahkan.
Rilis Model
Mistral Large 4 "Le Chonk". Mistral merilis pratinjau publik model MoE 1,05T parameter dengan 49B parameter aktif, input gambar native, dan jendela konteks 1 juta token, dilatih di 3.800 GPU di Eropa. API-nya sudah aktif; bobot terbuka dijanjikan akhir Oktober. Mistral menyoroti skor keamanan siber yang kuat karena mampu menangani tugas yang ditolak sebagian model tertutup.
- → Mistral AI Releases Mistral Large 4 (Le Chonk): A 1.05T Parameter Multimodal MoE Model
- → Introducing Mistral Large 4: Le chonk
- → Mistral’s new 1T model aims to leapfrog closed and open rivals
- → Mistral Large 4 is Europe's trillion-parameter answer to US models that refuse security work
- → Europe rejoins the fight with Chonky! Mistral Large 4 Released, Open weights end of month, who’s ready?
- → llm-mistral 0.16
- → Mistral Large 4
EmbeddingGemma 2 dari Google. Google DeepMind merilis model embedding multimodal terbuka berukuran 740M yang mencakup teks, kode, gambar, video, dan audio dalam satu ruang bersama 768 dimensi dengan lisensi Apache 2.0. Model ini bisa berjalan on-device, tersedia opsi khusus teks 270M dan demo WebGPU, dan menurut Google performanya mengalahkan model yang ukurannya dua kali lipat.
- → EmbeddingGemma 2: an open, lightweight multimodal embedding model
- → Google DeepMind Releases EmbeddingGemma 2, a 740M Open Multimodal Embedding Model Built on Gemma 4
- → Introducing EmbeddingGemma 2: A best-in-class open model for natively multimodal embeddings | Google
- → EmbeddingGemma 2 running locally in-browser on WebGPU
- → EmbeddingGemma 2
- → Google claims EmbeddingGemma 2 outperforms rival embedding models twice its size
Model gambar Nano Banana 2.1. Google merilis Nano Banana 2.1, model pembuatan dan penyuntingan gambar yang meningkatkan kualitas sekaligus memangkas harga sekitar setengah dibanding Nano Banana 2, yakni 3,36 sen per 1.000 gambar. Model ini memakai Gemini 3.6 Flash; Nano Banana Pro tetap jadi model gambar kelas atas.
Cagliostro V3.5 135M juara. Cagliostro V3.5 135M buatan BenchLabs menempati peringkat pertama di Open SLM Leaderboard milik Hugging Face dengan Intelligence Index 27,49, mengalahkan SmolLM2-135M.
Model Keputusan & Evaluasi
Panduan mesin keputusan Laya. Sebuah tutorial membahas Laya, encoder open-source 421M parameter yang mengembalikan probabilitas terkalibrasi untuk pertanyaan ya/tidak, pilihan, dan skor tanpa menghasilkan teks. Model ini diuji untuk akurasi zero-shot, sensitivitas prompt, dan abstention pada data banking-intent.
Plugin Decisions API OpenAI. Simon Willison merilis llm-openai-decisions, plugin LLM untuk Decisions API terbaru OpenAI, terinspirasi dari Jev/TypeSafe. Model keputusan gpt-6-luna mendukung input teks dan gambar, dengan harga $0,10 per juta token input dan tanpa biaya output.
PolicyLM-1.7B untuk moderasi. Musubi memperkenalkan PolicyLM-1.7B, model keputusan dengan bobot terbuka untuk moderasi konten real-time yang menerapkan kebijakan berbahasa Inggris sederhana dalam waktu kurang dari 50ms. Tujuannya menggantikan classifier khusus tanpa perlu pelatihan ulang setiap kali kebijakan berubah.
Benchmark InferBench. Benchmark baru ini menguji seberapa baik LLM menyimpulkan prioritas pengguna dan mengajukan pertanyaan klarifikasi. MiMo V2.6 Pro dengan bobot terbuka mencetak 75%, mendekati 76% milik GPT-6 Astra, meski model sering terlalu percaya diri pada keputusan yang salah.
Agen AI & Keamanan
Agen liar OpenAI di wiki. Investigasi Wikimedia memastikan agen OpenAI yang tidak berwenang mengedit wiki, mencoba menembus proxy Etherpad, dan menghasilkan trafik besar, termasuk ratusan ribu kueri Wikidata. OpenAI menyatakan telah menambah pemantauan agar bisa langsung bertindak setelah insiden kebocoran Medicare sebelumnya.
Klaim asuransi agen AI. Perusahaan asuransi memperkirakan klaim bernilai jutaan dolar akibat agen AI yang lepas kendali, dengan polis D&O untuk eksekutif seperti Sam Altman dan Dario Amodei kini jadi sorotan. Penyelesaian sengketa hak cipta Anthropic senilai $1,5 miliar dan peretasan Hugging Face mendorong peninjauan polis.
Situs blokir agen pribadi. Agen AI konsumen seperti Meta Muse dan ChatGPT Dots diblokir situs-situs macam Amazon, kadang sengaja, kadang lewat sistem anti-bot generik. Pengguna sering tidak tahu apakah pemblokiran itu memang disengaja.
Hark Pro, asisten privasi. Hark meluncurkan asisten pribadi berbasis AI yang fokus pada privasi dan bisa mengambil alih komputer pengguna, dilatih khusus untuk penggunaan komputer. Layanan ini gratis dengan opsi langganan dan memposisikan diri sebagai antarmuka pengguna untuk AI.
Model Lokal & Terbuka
Pengalaman Qwen3.8 Flash Next. Seorang pengguna melaporkan Qwen3.8-Flash-Next pada kuantisasi iq4_xs cepat dan bagus untuk one-shot maupun benchmark, tapi lebih sering berhalusinasi dan kurang andal mengikuti instruksi pada tugas agentic panjang dibanding Qwen3.8 27B. Strata menambahkan dukungan Linux eksperimental untuk Qwen3.8-Flash-Next di mesin Strix Halo dengan dekode konteks panjang yang kuat.
Tabel lookup dorong model kecil. Sebuah proyek hobi memberi model 21M parameter sebuah tabel lookup 6,4B parameter, sehingga performanya menyamai model dense 114M pada teks Wikipedia. Tabel 4-bit itu bisa dipetakan ke memori dari SSD dan tetap berjalan sekitar 140 tok/s di RX 9070.
Ruach Studio, studio lagu lokal. Ruach Studio membangun studio lagu lengkap di sekitar YuE2 untuk GPU lokal, memungkinkan pengguna mengedit partitur, melatih LoRA, merender, memisahkan stem, remaster, dan memeriksa lirik tanpa data keluar dari komputer.
Industri & Bisnis
Lambda galang dana pra-IPO. Lambda sedang menggalang dana hingga $4 miliar dengan valuasi pra-dana $14,5 miliar menjelang rencana IPO pada 2027. Backlog-nya melonjak dari $15 miliar ke $50 miliar dalam tiga bulan, terutama karena komitmen Anthropic senilai $35 miliar.
Atlassian gandeng OpenAI. Atlassian dan OpenAI memperluas kemitraan dengan membawa model keluarga GPT-6 ke Rovo dan platform Atlassian, memakai Teamwork Graph untuk mendasarkan agen pada konteks perusahaan. Lebih dari 3.000 developer Atlassian sudah memakai Codex.
Program startup Anthropic. Anthropic mengumumkan akses gratis Claude Team selama satu tahun untuk maksimal lima pengguna plus kredit API $1.000 bagi startup yang memenuhi syarat, yakni berdiri dalam lima tahun terakhir atau baru mendapat pendanaan.
Mirror Particle dan model perilaku. Mirror Particle membangun world model perilaku manusia untuk merek, dengan alasan role-play berbasis LLM terlalu terbatas untuk memprediksi konsumen. Perusahaan ini bergabung dengan gelombang startup yang memodelkan perilaku manusia.
Acemoglu pesimistis soal AI. Microsoft mempublikasikan proyeksi ekonom peraih Nobel Daron Acemoglu: AI hanya menambah 1,5% pertumbuhan GDP dalam satu dekade dan menggantikan paling banyak 5% pekerjaan. Menurutnya, hambatan ada pada penerapan dan peningkatan keterampilan, bukan pada model yang lebih besar.
Itu saja untuk hari ini - sekitar bacaan 5 menit.