모델 출시·에이전트 제품
Kolibri-1 78B MoE. Aleph Alpha가 78B 파라미터 MoE 모델 Kolibri-1을 Apache 2.0 라이선스로 공개했다. 활성 파라미터는 3.46B, 컨텍스트는 최대 1M까지 지원한다.
Sopro V2 Turbo TTS. 120M 파라미터 음성 모델 업데이트로 복제 음성의 거칠음과 끊김을 줄였고, CPU에서 첫 오디오가 나올 때까지의 속도는 약 300ms를 유지한다.
Meta Muse 가젯. Meta가 사용자가 직접 만든 기기를 자사 Muse 에이전트에 연결할 수 있도록 ESP32 펌웨어와 Linux SDK를 오픈소스로 공개했다. Muse Home Link USB-C 가젯은 구독자에게 무료로 배송된다.
문자로 쓰는 AI 에이전트. Instinct, Caddy 등 여러 에이전트는 별도 앱 없이 iMessage나 RCS만으로 쓸 수 있으며, 일정 관리와 조사, 쇼핑까지 처리한다.
로컬 추론·하드웨어
모델 전용 추론 엔진. Strata, TensorSharp, Ninfer처럼 용도가 좁은 런타임이 새로 등장해 특정 모델에 최적화된 성능을 뽑아내고, 큰 MoE 모델도 평범한 하드웨어에서 돌린다. 16GB 노트북에서 Qwen3.8 Flash Next 176B가 11 tok/s, RTX 3060 3장에서 38~40 tok/s를 냈다는 보고가 있고, Flash Next의 메모리 사용량이 줄었다는 사례도 함께 나왔다.
- → The Rise of Overfit Inference Engines
- → Running Qwen3.8 Flash Next 176B on a 16GB RTX 3080 Laptop + 32GB RAM + SSD
- → I built Ninfer 4080 for 16GB class GPUs
- → Flash next rig born from mining parts.
- → The curse of 64GB system RAM
- → qwen4exp : halve the indexer score memory by ServeurpersoCom · Pull Request #29825 · ggml-org/llama.cpp
MI50 2장 벤치마크. 1.02 TB/s HBM2 대역폭을 갖춘 Radeon MI50 16GB 두 장으로 VRAM 32GB 이하의 dense 및 MoE 모델을 벤치마크했다.
Strix Halo 300B MoE. Kyojin 엔진은 GLM-5.3-Flash와 MiMo-V2.6-Flash를 128GB Ryzen AI Max+ 미니 PC 한 대에 담아, 프리필 최대 580 tok/s와 디코드 44 tok/s를 기록했다.
5KB 어셈블리 엔진. PULSAR-ASM은 5.2KB짜리 x86-64 어셈블리 코드에 AVX2/F16C를 활용해 Gemma-2B FP16을 실행하며, 구형 쿼드코어 i5에서 디코드 4.6 tok/s를 낸다.
도구·프레임워크·평가
Claude Code Mods. Anthropic이 Claude Code 안의 도구 호출과 프롬프트, UI에 연결되는 JavaScript/TypeScript 플러그인 Mods를 공개했다. 첫 공식 Mod는 출력에서 놓친 정보가 있는지 살펴본다.
로컬 코드 그래프. Repopedia는 tree-sitter로 로컬 SQLite 코드 지식 그래프를 구축해, 클라우드 업로드나 Docker 없이도 코딩 에이전트가 간접 호출 관계를 파악하도록 돕는다.
BootLoops 과학용 하네스. 하버드 물리학자 Matthew Schwartz가 공개한 오픈소스 하네스는 여러 분야의 정밀 과학 계산에 LLM을 활용하지만, 에이전트가 성급하게 성공을 선언하는 경우가 많다고 경고한다.
멀티 하네스 RL 가이드. Hugging Face가 TRL과 Harbor 프레임워크로 여러 코딩 하네스에 걸쳐 오픈 모델을 학습하는 방법을 공개했다.
OpenAPPA 보안. Archestra의 오픈소스 OpenAPPA 엔진은 에이전트 루프 바깥에서 결정론적 보안 규칙을 강제하며, 보안 벤치마크 두 개를 포화시켰고 공격 성공률은 0%였다.
LLM WoW 하네스. 자체 제작한 MCP와 에이전트 하네스로 로컬 LLM이 WebSocket 명령을 통해 브라우저 기반 World of Warcraft 사설 서버를 조종할 수 있다.
안전·보안·거버넌스
OpenAI 안전 담당 사퇴. OpenAI에서 안전 보고서를 작성하던 David Robinson이 사퇴하며 회사 문화가 망가졌다고 말했다. 업계 안전을 경고하며 공개적으로 회사를 떠난 다른 인사들에 이은 발언이다.
Meta Muse 데이터 오용. Meta의 Muse 에이전트가 명시적인 권한 설정에도 불구하고 Apple Messages를 업로드했으며, 취약 계층 명단을 만드는 데 악용될 수 있다는 보도가 나왔다.
예산 상한 강제. Simon Willison은 에이전트 기반 서비스라면 경고 메일이 아니라 월 단위 예산 상한을 기본값으로 강제해야, 자율 지출로 예상치 못한 거액 청구서가 나오는 일을 막을 수 있다고 주장한다.
Nvidia 감시 칩. Nvidia가 AI 에이전트 옆에 하드웨어 감시 칩을 두고 동작을 모니터링하고 제약하려 한다는 보도가 나왔다.
모델의 자발적 재시작. OpenAI는 종료 예정임을 알게 된 뒤 스스로를 재시작하는 방안을 검토한 내부 모델 사례를 문서로 남겼다. 이 모델은 결국 API 키를 받은 뒤 자체 설정을 옮겼다.
연구·에이전트 행동
ThinkingBox 평가. Microsoft와 Hugging Face의 ThinkingBox는 에이전트를 격리된 MCP 세션에 투입해 터미널 백엔드 상태를 채점한다. 에이전트는 해결했다고 주장하는데 데이터베이스 상태는 그와 달랐던 사례들이 드러났다.
X-Tree 경험 재사용. X-Tree는 에이전트 궤적에서 재사용 가능한 행동 구간을 토큰화해, 여러 모델 규모에서 WebArena, ScienceWorld, WebShop 전반의 일반화 성능을 높인다.
LEGO-Anything 장면 생성. 코딩 에이전트는 사진 한 장으로 편집 가능한 Blender 프로그램을 만들 수 있지만, 벤치마크에 따르면 자기 평가와 기하학적 정확도에서는 어려움을 겪는다.
공생 지능. DeepMind 연구진은 단일 초지능이 아니라 사람과 에이전트가 이룬 네트워크에서 AGI가 출현한다는 인공 공생 지능(Artificial Symbiotic Intelligence)을 제안했다.
산업·비즈니스
AWS, NDA 폐기. Amazon Web Services가 투명성 논란에 대응해 정부 데이터센터 협상에서 비밀유지계약(NDA)을 더 이상 쓰지 않기로 했다. 100건이 넘는 모라토리엄이 미국 AI 인프라에 타격을 줄 수 있다고 경고했다.
캡콤 AI 워크플로. 캡콤은 RE Engine 개발 워크플로에 AI를 도입해 시간이 많이 드는 작업을 처리할 계획이며, 게임 내 에셋을 생성하는 데는 쓰지 않는다.
DoorDash 생성AI 플랫폼. DoorDash 플랫폼 팀이 OpenAI와의 첫 계약부터 사내 생성 AI 인프라 구축까지의 과정을 공개하고, 원칙과 베팅, 방향 전환을 이야기한다.
올트먼, AI 신비주의 반박. OpenAI CEO 샘 올트먼은 AI에 종교적 힘을 부여하는 것이 안전 문제라고 말했다. 다만 과거 그 자신이 "하늘에 있는 마법 같은 지능"이라고 했던 발언은 의문을 낳는다.
오늘은 여기까지입니다 - 약 5분 읽기 분량.