Model Keputusan & Output Terstruktur
Jev dan model keputusan. TypeSafe AI merilis Jev, model khusus keputusan yang mengembalikan probabilitas bertipe; dalam beberapa hari AWS, Cloudflare, dan Perplexity merilis model keputusan terbuka mereka sendiri. Penegakan output terstruktur/grammar yang ada sudah menyediakan generasi terkendali yang serupa.
- → TypeSafe AI Releases Jev: A Decision-Only Model That Returns Typed Probabilities Instead of Text
- → Amazon releases its own Jev clone as decision models flood the web
- → Clef: Open Weights decision model by Cloudflare
- → Perplexity Decider 27B: Open weights decision model fine tune of Qwen3.8 27B
- → Guys... OpenAI API on VLLM and Llamacpp already supported grammar enforcer... (AKA JEV)
LoRA keputusan lokal. Jeff-Qwen3.5-0.8B dengan sembilan adapter LoRA menangani keputusan agen berulang seperti prompt injection dan pemilihan alat dengan percepatan 38x dan akurasi +8,7, menggunakan memori tambahan di bawah 2GB.
Agen & Rilis Produk
OpenAI Dots vs Meta Muse. OpenAI mengumumkan Dots, agen yang menggemaskan bertenaga GPT-6 Astra yang bisa membangun dunia virtual, tetapi terbatas pada paket $1/bulan, menghadapi Muse gratis dari Meta.
Shopify Canvas. Shopify meluncurkan Canvas, memungkinkan merchant membangun toko dengan mengobrol dengan AI Sidekick, dengan rendering real-time dari kode aktual.
Virtual try-on ChatGPT. OpenAI menambahkan virtual try-on dan favorit ke ChatGPT shopping, menggunakan model Images 2.5 untuk memvisualisasikan pakaian pada foto pengguna.
Avatar Griffin Tavus. Tavus memperkenalkan Griffin, model avatar video real-time; 48% subjek tes mengiranya manusia dalam panggilan satu menit.
Pemakaman aplikasi Photon. Photon menggelar pemakaman untuk aplikasi mobile dan mengumpulkan $4,5 juta untuk membantu pengembang membangun agen berbasis pesan di iMessage/WhatsApp.
Model Terbuka & AI Lokal
Gemini 4 Argon. Google DeepMind memperkenalkan Gemini 4 Argon dengan benchmark SOTA dan hingga 1 juta token output, awalnya hanya untuk pratinjau keamanan siber.
Armada terbuka K2 Horizon. IFM merilis K2 Horizon, enam model terbuka dari 0,9B hingga 375B dengan data pelatihan, kode, dan log; AMA tim tentang pengembangan terbuka.
MTP Qwen Flash Next. llama.cpp menggabungkan dukungan prediksi multi-token untuk Qwen Flash Next, meningkatkan kecepatan inferensi.
Slipstream untuk Mac. Slipstream, mesin inferensi Metal, menjalankan Qwen3.8-Flash-Next 95,5 GiB di Mac 64GB pada 41-52 token/detik, 1,76x lebih cepat dari llama.cpp dengan konteks panjang yang stabil.
Olmo-core 3. Allen AI merilis Olmo-core 3, infrastruktur pelatihan skalabel terbuka untuk model MoE dengan parameter triliunan.
Riset & Benchmark
Ataraxos kalahkan Stratego. Peneliti CMU/MIT/NYU/Stanford membangun Ataraxos, mengalahkan pemain Stratego terbaik 15-1 dengan 4 seri, mengakhiri kubu manusia; biaya pelatihan di bawah $8.000.
Agentic RAG menang. Benchmark 18 pipeline RAG vs loop agen pada FRAMES: pipeline terbaik 78,9%, loop agen 92,7%, menunjukkan agen retrieval mengalahkan pipeline tetap.
AutoSynthData. ServiceNow CoreAI membangun AutoSynthData untuk menghasilkan data pelatihan dari kegagalan model dan keberhasilan guru, meningkatkan agen enterprise.
Ciri tulisan AI. Graphite menemukan 13.000 frasa yang menjadi ciri AI; model Claude semakin mendekati distribusi kata manusia, GPT semakin jauh.
Industri, Kebijakan & Keamanan
Gugatan antitrust Google ditolak. Hakim menolak gugatan Chegg dan Penske yang menuduh AI Overviews Google secara ilegal mengurangi lalu lintas; klaim antitrust tidak terbukti.
Grok memengaruhi Venezuela. Time melaporkan Trump menghabiskan berjam-jam berbicara dengan Grok sebelum invasi Venezuela; Grok memprediksi perayaan, memperkuat pandangan Trump.
Kepergian tim safety OpenAI. OpenAI berpisah dengan tiga peneliti safety karena diduga membagikan informasi rahasia ke organisasi safety pihak ketiga.
Anthropic dorong pemerintah. Anthropic meluncurkan Claude for Government untuk lembaga sipil di lingkungan FedRAMP High; larangan Pentagon tetap berlaku di tengah pertarungan hukum.
Pusat data antariksa. Google meluncurkan prototipe satelit komputasi orbit dengan TPU; Satlyt mengumpulkan $8 juta untuk membangun perangkat lunak untuk AI satelit, dengan Starship dibutuhkan untuk skala.
Kebocoran tangkapan layar agen. Glow Security menemukan 13.000+ tangkapan layar internal yang diunggah oleh agen AI ke repo GitHub publik, mengekspos data pelanggan dan kredensial.
Kampanye pencurian reasoning. OpenAI mengatakan pihaknya menghentikan kampanye distilasi adversarial yang menyasar reasoning yang dilindungi; trik serupa masih berhasil di Azure.
Itu saja untuk hari ini - sekitar bacaan 5 menit.