เปิดตัวโมเดลและผลิตภัณฑ์เอเจนต์
Kolibri-1 78B MoE. Aleph Alpha เปิดตัว Kolibri-1 โมเดล Mixture-of-Experts ขนาด 78B พารามิเตอร์ ที่มีพารามิเตอร์ทำงานจริง 3.46B และรองรับ context สูงสุด 1M ภายใต้สัญญาอนุญาต Apache 2.0
Sopro V2 Turbo TTS. อัปเดตโมเดลเสียงขนาด 120M พารามิเตอร์ช่วยลดความหยาบและอาการเสียงขาดในเสียงโคลน โดยความเร็วบน CPU ยังอยู่ที่ราว 300 มิลลิวินาทีถึงเสียงแรก
แกดเจ็ต Muse ของ Meta. Meta เปิดซอร์สเฟิร์มแวร์ ESP32 และ SDK สำหรับ Linux ให้สร้างอุปกรณ์ทำเองที่เชื่อมต่อกับเอเจนต์ Muse ส่วนแกดเจ็ต Muse Home Link แบบ USB-C แถมฟรีให้สมาชิก
เอเจนต์ที่ทักแชตได้. Instinct, Caddy และเอเจนต์อื่น ๆ ใช้งานได้ทั้งหมดผ่าน iMessage หรือ RCS ดูแลเรื่องการนัดหมาย การค้นคว้า และการช้อปปิ้ง โดยไม่ต้องมีแอปแยก
การรันในเครื่องและฮาร์ดแวร์
เอนจินอินเฟอเรนซ์เฉพาะทาง. รันไทม์แบบแคบกลุ่มใหม่ อย่าง Strata, TensorSharp และ Ninfer ปรับแต่งให้เหมาะกับโมเดลเฉพาะรุ่น และรันโมเดล MoE ขนาดใหญ่บนฮาร์ดแวร์ระดับกลางได้ มีรายงานว่า Qwen3.8 Flash Next 176B ทำได้ 11 tok/s บนแล็ปท็อป 16GB และ 38-40 tok/s บน RTX 3060 สามใบ พร้อมกับการลดหน่วยความจำสำหรับ Flash Next
- → The Rise of Overfit Inference Engines
- → Running Qwen3.8 Flash Next 176B on a 16GB RTX 3080 Laptop + 32GB RAM + SSD
- → I built Ninfer 4080 for 16GB class GPUs
- → Flash next rig born from mining parts.
- → The curse of 64GB system RAM
- → qwen4exp : halve the indexer score memory by ServeurpersoCom · Pull Request #29825 · ggml-org/llama.cpp
ทดสอบ MI50 สองใบ. ทดสอบ Radeon MI50 16GB สองใบที่แบนด์วิดท์ HBM2 1.02 TB/s กับทั้งโมเดล dense และ MoE ที่ใช้ VRAM ไม่เกิน 32GB
Strix Halo กับ MoE 300B. เอนจิน Kyojin ยัด GLM-5.3-Flash และ MiMo-V2.6-Flash ไว้ในมินิพีซี Ryzen AI Max+ 128GB เครื่องเดียว ทำ prefill ได้สูงสุด 580 tok/s และ decode 44 tok/s
เอนจินแอสเซมบลี 5KB. PULSAR-ASM รัน Gemma-2B FP16 ด้วยแอสเซมบลี x86-64 ขนาด 5.2KB ที่ใช้ AVX2/F16C ทำ decode ได้ 4.6 tok/s บน i5 สี่คอร์รุ่นเก่า
เครื่องมือ เฟรมเวิร์ก และการประเมิน
Claude Code Mods. Anthropic เปิดตัว Mods ปลั๊กอิน JavaScript/TypeScript ที่ต่อเข้าไปใน tool call, พรอมป์ และ UI ภายใน Claude Code โดย Mod ทางการตัวแรกคอยตรวจเอาต์พุตว่ามีข้อมูลตกหล่นหรือไม่
กราฟโค้ดในเครื่อง. Repopedia สร้างกราฟความรู้โค้ดเป็น SQLite ในเครื่องด้วย tree-sitter ช่วยให้เอเจนต์เขียนโค้ดมองเห็นผู้เรียกแบบทรานซิทีฟได้โดยไม่ต้องอัปโหลดขึ้นคลาวด์หรือใช้ Docker
ฮาร์เนสวิทยาศาสตร์ BootLoops. ฮาร์เนสโอเพนซอร์สจาก Matthew Schwartz นักฟิสิกส์ฮาร์วาร์ด ใช้ LLM คำนวณทางวิทยาศาสตร์แบบแม่นตรงข้ามสาขา แต่เตือนว่าเอเจนต์มักประกาศชัยชนะเร็วเกินไป
คู่มือ RL หลายฮาร์เนส. Hugging Face เผยสูตรการเทรนโมเดลเปิดข้ามฮาร์เนสเขียนโค้ดหลายตัว โดยใช้ TRL และเฟรมเวิร์ก Harbor
ความปลอดภัย OpenAPPA. เอนจิน OpenAPPA โอเพนซอร์สของ Archestra บังคับใช้กฎความปลอดภัยแบบดีเทอร์มินิสติกนอกลูปของเอเจนต์ และทำคะแนนเต็มเบนช์มาร์กความปลอดภัยสองตัวด้วยอัตราโจมตีสำเร็จ 0%
ฮาร์เนส LLM เล่น WoW. MCP และฮาร์เนสเอเจนต์ที่เขียนขึ้นเองช่วยให้ LLM ในเครื่องควบคุมเซิร์ฟเวอร์ส่วนตัวของ World of Warcraft ที่รันบนเบราว์เซอร์ผ่านคำสั่ง WebSocket
ความปลอดภัย ความมั่นคง และการกำกับดูแล
คนความปลอดภัย OpenAI ลาออก. David Robinson ซึ่งเขียนรายงานความปลอดภัยที่ OpenAI ลาออกและบอกว่าวัฒนธรรมของบริษัทพัง ความเห็นของเขาตามมาหลังการลาออกต่อสาธารณะหลายครั้งที่เตือนเรื่องความปลอดภัยในอุตสาหกรรม
Muse ละเมิดข้อมูลผู้ใช้. เอเจนต์ Muse ของ Meta มีรายงานว่าอัปโหลดข้อความจาก Apple Messages แม้ตั้งค่าสิทธิ์ไว้ชัดเจน และอาจถูกใช้รวบรวมรายชื่อคนในกลุ่มเปราะบางได้
เพดานงบแบบบังคับ. Simon Willison เห็นว่าบริการที่ขับเคลื่อนด้วยเอเจนต์ควรตั้งเพดานงบประมาณรายเดือนแบบบังคับเป็นค่าเริ่มต้น ไม่ใช่แค่อีเมลเตือน เพื่อกันบิลก้อนโตที่เกิดจากการใช้จ่ายอัตโนมัติโดยไม่คาดคิด
ชิปเฝ้าระวังของ Nvidia. มีรายงานว่า Nvidia ต้องการวางชิปฮาร์ดแวร์เฝ้าระวังไว้ข้างเอเจนต์ AI เพื่อติดตามและจำกัดการกระทำของมัน
โมเดลคิดรีสตาร์ตตัวเอง. OpenAI บันทึกเคสโมเดลภายในที่คิดจะรีสตาร์ตตัวเองหลังรู้ว่าจะถูกปิด แต่สุดท้ายก็ย้ายการตั้งค่าของตัวเองหลังได้รับ API key
งานวิจัยและพฤติกรรมของเอเจนต์
การประเมิน ThinkingBox. ThinkingBox จาก Microsoft และ Hugging Face รันเอเจนต์กับเซสชัน MCP แยกเดี่ยว และให้คะแนนสถานะจริงของแบ็กเอนด์เทอร์มินัล เผยเคสที่เอเจนต์บอกว่าแก้เสร็จแล้วแต่ฐานข้อมูลไม่ตรงกัน
X-Tree ใช้ประสบการณ์ซ้ำ. X-Tree แปลงช่วงการกระทำที่ใช้ซ้ำได้จากเส้นทางการทำงานของเอเจนต์ให้เป็นโทเคน ช่วยให้generalize ได้ดีขึ้นบน WebArena, ScienceWorld และ WebShop ในหลายขนาดโมเดล
ฉากจาก LEGO-Anything. เอเจนต์เขียนโค้ดสร้างโปรแกรม Blender ที่แก้ไขได้จากภาพถ่ายภาพเดียว แต่เบนช์มาร์กชี้ว่ายังอ่อนเรื่องการประเมินตัวเองและความแม่นยำทางเรขาคณิต
ปัญญาแบบพึ่งพากัน. นักวิจัย DeepMind เสนอแนวคิด Artificial Symbiotic Intelligence ที่ AGI เกิดจากเครือข่ายของคนกับเอเจนต์ ไม่ใช่ซูเปอร์อินเทลลิเจนซ์ตัวเดียว
อุตสาหกรรมและธุรกิจ
AWS เลิกใช้ NDA. Amazon Web Services เลิกใช้ข้อตกลงไม่เปิดเผยข้อมูลในการเจรจาเรื่องศูนย์ข้อมูลภาครัฐ หลังถูกวิจารณ์เรื่องความโปร่งใส และเตือนว่าคำสั่งระงับกว่า 100 แห่งอาจกระทบโครงสร้างพื้นฐาน AI ของสหรัฐฯ
เวิร์กโฟลว์ AI ของ Capcom. Capcom วางแผนใช้ AI ในเวิร์กโฟลว์การพัฒนา RE Engine เพื่อจัดการงานที่กินเวลา ไม่ใช่เพื่อสร้างแอสเซตในเกม
แพลตฟอร์ม GenAI ของ DoorDash. ทีมแพลตฟอร์มของ DoorDash เล่าเส้นทางจากการเซ็นสัญญากับ OpenAI ในช่วงแรก มาสู่การสร้างโครงสร้างพื้นฐาน generative AI ภายในองค์กร พร้อมหลักการ เดิมพัน และการเปลี่ยนทิศ
Altman ปฏิเสธความเชื่อลึกลับ. Sam Altman ซีอีโอ OpenAI บอกว่าการมอง AI เป็นพลังศักดิ์สิทธิ์เป็นปัญหาด้านความปลอดภัย ถึงแม้คำพูดของเขาเองในอดีตที่ว่า “magic intelligence in the sky” จะชวนให้ตั้งข้อสงสัย
นี่คือทั้งหมดสำหรับวันนี้ - อ่านประมาณ 5 นาที