โมเดลตัดสินใจและ Structured Output
Jev กับโมเดลตัดสินใจ. TypeSafe AI เปิดตัว Jev โมเดลที่ทำหน้าที่ตัดสินใจเท่านั้นและคืนค่าความน่าจะเป็นแบบมี type ภายในไม่กี่วัน AWS, Cloudflare และ Perplexity ต่างเปิดโมเดลตัดสินใจแบบเปิดของตัวเอง ขณะที่ structured output/grammar enforcement ที่มีอยู่ก็ให้ constrained generation คล้ายกันอยู่แล้ว
- → TypeSafe AI Releases Jev: A Decision-Only Model That Returns Typed Probabilities Instead of Text
- → Amazon releases its own Jev clone as decision models flood the web
- → Clef: Open Weights decision model by Cloudflare
- → Perplexity Decider 27B: Open weights decision model fine tune of Qwen3.8 27B
- → Guys... OpenAI API on VLLM and Llamacpp already supported grammar enforcer... (AKA JEV)
LoRA ตัดสินใจบนเครื่อง. Jeff-Qwen3.5-0.8B ที่มี LoRA adapter 9 ตัวรับมือการตัดสินใจซ้ำ ๆ ของ agent อย่าง prompt injection และการเลือก tool ได้เร็วขึ้น 38 เท่า ความแม่นยำเพิ่ม 8.7 โดยใช้หน่วยความจำเพิ่มไม่ถึง 2GB
Agent และการเปิดตัวผลิตภัณฑ์
OpenAI Dots ปะทะ Meta Muse. OpenAI เปิดตัว Dots agent น่ารัก ๆ ที่ขับเคลื่อนด้วย GPT-6 Astra และสร้างโลกเสมือนได้ แต่จำกัดไว้ในแพ็กเกจ 1 ดอลลาร์ต่อเดือน ต้องเจอกับ Muse ฟรีของ Meta
Shopify Canvas. Shopify เปิดตัว Canvas ให้ร้านค้าสร้างหน้าร้านด้วยการแชตกับ AI Sidekick พร้อมเรนเดอร์โค้ดจริงแบบเรียลไทม์
ChatGPT ลองเสมือนจริง. OpenAI เพิ่มฟีเจอร์ลองเสมือนจริงและรายการโปรดให้ ChatGPT shopping โดยใช้โมเดล Images 2.5 แสดงเสื้อผ้าบนรูปผู้ใช้
Tavus Griffin อวตาร. Tavus เปิดตัว Griffin โมเดลอวตารวิดีโอเรียลไทม์ ผู้ทดสอบ 48% เข้าใจผิดว่าเป็นมนุษย์ในการคอลหนึ่งนาที
งานศพแอป Photon. Photon จัดงานศพให้แอปมือถือ และระดมทุนได้ 4.5 ล้านดอลลาร์ เพื่อช่วยนักพัฒนาสร้าง agent ที่ทำงานผ่านข้อความบน iMessage/WhatsApp
โมเดลเปิดและ Local AI
Gemini 4 Argon. Google DeepMind เปิดตัว Gemini 4 Argon พร้อมผล benchmark ระดับ SOTA และเอาต์พุตได้สูงสุด 1 ล้านโทเคน โดยช่วงแรกเปิดให้พรีวิวเฉพาะงานความมั่นคงไซเบอร์
K2 Horizon เปิดโมเดลชุดใหญ่. IFM เปิดตัว K2 Horizon โมเดลเปิด 6 ตัว ตั้งแต่ 0.9B ถึง 375B พร้อมข้อมูลฝึก โค้ด และ log ทีมจัด AMA เรื่องการพัฒนาแบบเปิด
Qwen Flash Next MTP. llama.cpp รวมการรองรับ multi-token prediction สำหรับ Qwen Flash Next ช่วยให้ความเร็ว inference ดีขึ้น
Slipstream บน Mac. Slipstream เอนจิน inference บน Metal รัน Qwen3.8-Flash-Next ขนาด 95.5 GiB บน Mac 64GB ได้ที่ 41-52 tok/s เร็วกว่า llama.cpp 1.76 เท่า พร้อม long context ที่เสถียร
Olmo-core 3. Allen AI เปิดตัว Olmo-core 3 โครงสร้างพื้นฐานการฝึกแบบเปิดที่ขยายได้สำหรับโมเดล MoE ระดับล้านล้านพารามิเตอร์
งานวิจัยและ Benchmark
Ataraxos ชนะ Stratego. นักวิจัยจาก CMU/MIT/NYU/Stanford สร้าง Ataraxos เอาชนะผู้เล่น Stratego ที่เก่งที่สุด 15-1 โดยเสมอ 4 เกม ยุติความเหนือของมนุษย์ในเกมนี้ ด้วยต้นทุนฝึกไม่ถึง 8,000 ดอลลาร์
Agentic RAG เหนือกว่า. การ benchmark RAG pipeline 18 แบบเทียบกับ agent loop บน FRAMES พบว่า pipeline ที่ดีที่สุดได้ 78.9% ส่วน agent loop ได้ 92.7% ชี้ว่า retrieval agent ทำงานได้ดีกว่า pipeline แบบตายตัว
AutoSynthData. ServiceNow CoreAI สร้าง AutoSynthData เพื่อสร้างข้อมูลฝึกจากกรณีที่โมเดลล้มเหลวและกรณีที่ teacher ทำสำเร็จ ช่วยยกระดับ enterprise agent
สัญญาณ AI ในการเขียน. Graphite พบวลี 13,000 วลีที่เป็นสัญญาณบอกว่าเป็น AI โดยโมเดล Claude กำลังเข้าใกล้การกระจายคำของมนุษย์มากขึ้น ขณะที่ GPT ห่างออกไป
อุตสาหกรรม นโยบาย และความปลอดภัย
คดีผูกขาด Google ถูกยกฟ้อง. ผู้พิพากษายกฟ้องคดีที่ Chegg และ Penske กล่าวหา Google AI Overviews ว่าลดทราฟฟิกอย่างผิดกฎหมาย ข้อกล่าวหาด้านการผูกขาดไม่ฟังขึ้น
Grok มีอิทธิพลต่อเวเนซุเอลา. Time รายงานว่า Trump ใช้เวลาหลายชั่วโมงพูดคุยกับ Grok ก่อนการบุกเวเนซุเอลา Grok คาดการณ์ว่าจะมีการฉลอง ซึ่งตอกย้ำมุมมองของ Trump
นักวิจัยความปลอดภัย OpenAI ออก. OpenAI แยกทางกับนักวิจัยด้านความปลอดภัย 3 คน หลังถูกกล่าวหาว่าแชร์ข้อมูลลับกับองค์กรความปลอดภัยภายนอก
Anthropic ลุยงานรัฐบาล. Anthropic เปิดตัว Claude for Government สำหรับหน่วยงานพลเรือนในสภาพแวดล้อม FedRAMP High ขณะที่คำสั่งห้ามของ Pentagon ยังมีผล ท่ามกลางการต่อสู้ทางกฎหมาย
Data center บนอวกาศ. Google ปล่อยดาวเทียมประมวลผลบนวงโคจรต้นแบบที่ติด TPU; Satlyt ระดมทุน 8 ล้านดอลลาร์เพื่อสร้างซอฟต์แวร์สำหรับ AI บนดาวเทียม โดยต้องใช้ Starship เพื่อขยายสเกล
Agent หลุดภาพหน้าจอ. Glow Security พบภาพหน้าจอภายในกว่า 13,000 ภาพที่ AI agent อัปโหลดขึ้น GitHub repo สาธารณะ เผยข้อมูลลูกค้าและ credential
แคมเปญขโมย reasoning. OpenAI กล่าวว่าหยุดแคมเปญ adversarial distillation ที่มุ่งเป้าไปที่ reasoning ที่ได้รับการป้องกันได้ แต่เทคนิคคล้ายกันยังได้ผลบน Azure
นี่คือทั้งหมดสำหรับวันนี้ - อ่านประมาณ 5 นาที