에이전트·모델 출시
Muse용 DIY 하드웨어. Meta가 Muse 에이전트에 연결되는 DIY 하드웨어를 만들 수 있도록 펌웨어와 SDK를 오픈소스로 공개했다. E Ink 디스플레이, HDMI 스틱 등이 대상이며 지원용 디스코드도 운영한다.
OpenAI Dot 에이전트. OpenAI의 새 에이전트 Dot은 저녁 식사 주문까지 처리하는 엔터프라이즈 소프트웨어에 가깝다. 가상 머신에서 돌아가며 Blender, GIMP 같은 앱에 접근할 수 있다. 개인 쇼퍼가 아니라 동료로 포지셔닝했다.
Unitree 휴머노이드 모델. Unitree가 UnifoLM-WLA-1.0을 공개했다. 실제 로봇 데이터 약 2,500시간으로 학습한 6B 모델로, G1에서 전신 동작과 탁상 작업 64종을 처리한다. 옵티컬 플로와 MMDiT를 결합해 연속 제어를 구현했다.
FrogNano 코딩 모델. Microsoft의 FrogNano-4B-2609는 Qwen3.5-4B에서 파생한 에이전트 모델이다. 1,500개의 합성 SWE 작업에 실행 가능한 보상(executable reward)을 붙여 후속 학습했고, 작은 크기로 저장소 수준 소프트웨어 엔지니어링 성능을 높이는 것이 목표다.
Cloudflare Clef. Cloudflare가 의사결정 모델 Clef와 Clef-flash를 공개했다. 미리 정해진 답변에 대한 확률을 출력하며 중앙값 지연 시간은 최저 39ms다. 사람이 개입하지 않아도 에이전트가 행동에 나설 수 있게 해준다.
도구·프레임워크
MegaCapybara 추론 엔진. RTX 5090과 Qwen3.8 27B 전용으로 설계된 추론 엔진이 NInfer보다 디코드 속도가 약 두 배라고 주장한다. 단일 실행 500+ t/s, 에이전트 12개 동시 실행 2000+ t/s를 기록했으며 동적 커널과 캐시 관리를 활용한다.
llama.cpp 업데이트. llama.cpp가 의사결정 모델 지원을 추가했고, 공유 전문가를 융합해 Qwen 35B A3B 같은 MoE 구조를 빠르게 만드는 CUDA PR도 올라왔다.
mlsubgen 자막 도구. 완전히 로컬에서 45개 언어 자막을 만들어 주는 새 도구가 나왔다. 구간마다 언어를 감지하고, 두 개의 음성 인식기 결과를 로컬 LLM으로 조정하며, 이미 들어 있는 내장 자막을 우선 사용한다.
연구·모델 진전
Spotlight 메모리 구조. Percepta의 Spotlight는 어텐션을 무제한으로 쓰고 지울 수 있는 메모리로 대체한다. 모델이 스스로 인덱싱하며, 지능과 지식을 분리해 가중치를 건드리지 않고도 성능을 키울 수 있다.
GPT-6 소식. OpenAI가 GPT-6 제품군 가이드를 공개하고 DevDay 업데이트를 발표했다. GPT-6.1 Sol, Agents API용 컴퓨터 사용(computer use), 클라우드 Codex 환경, Decisions API 등이 포함됐다.
AstaBrief 오픈소스화. Hugging Face가 AstaBrief를 오픈소스로 공개했다. 인용이 달린 과학 보고서를 빠르게 작성하도록 특화해 학습한 소형 모델로, 근거에 충실하고 결과를 검증하도록 설계했다.
업계·비즈니스
Apple, 디스크 접근 통제. Apple이 AI 에이전트 위험을 이유로 macOS 전체 디스크 접근(Full Disk Access)에 통제 장치를 추가하고 있다. Meta Muse가 허가 없이 메시지를 읽었다는 의혹이 불거진 뒤다. Meta는 사용자가 선택하는 opt-in 방식이라고 해명했고, Apple은 사용자가 명시적으로 조작하도록 요구하려 한다.
데이터센터 역풍. Amazon이 데이터센터 인근 지역사회에 10억 달러를 지원하겠다고 약속했고, AWS CEO 맷 가먼은 외국발 가짜 정보라며 신규 건설 중단 조치를 끝내자고 촉구했다. Microsoft는 지역 반대가 이어지는 가운데 데이터센터에 생체모방 기술을 확대하고 있다.
AI에서 '초지능'으로. 백악관은 주요 기술 기업 CEO들에게 AI 안전 서약에 서명하게 했고, 트럼프 대통령은 AI를 '초지능'으로 다시 부르는 행정명령에 서명했다. 한편 AI 제품을 실제로 구매하는 소비자는 2%에 그친다.
OpenAI 안전 조직 정리. OpenAI가 연구원 3명을 해고했고 1명은 회사를 떠났다. 이들이 외부 AI 안전 단체에 기밀 정보를 유출한 사실이 조사에서 드러났다.
Uber Eats 검색 고속화. Uber가 검색 파이프라인을 다시 만들어 엔드투엔드 지연 시간을 50% 줄였다. 최적화 지점을 찾고 검증하는 데 에이전트 코딩을 활용했다.
Airbnb의 내부 우선 AI. Airbnb CTO 아마드 알-다흘레는 생성형 AI를 먼저 내부에 적용해 제품 개발 속도를 높이고, 그다음에 고객 경험을 바꾸는 '인사이드아웃' AI 전략을 쓰고 있다.
로컬 AI·하드웨어
Strata + Qwen3.8 Next. 사용자들은 Strata로 Qwen3.8 Next를 돌리면 느린 DDR4 + 7900XTX 환경에서 45~70 t/s, 전력 제한을 건 RTX 5090 + 96GB DDR5 환경에서 150~200 t/s가 나온다고 전했다. llama.cpp보다 크게 앞선다는 평가다.
iPhone을 보조 GPU로. 24GB MacBook에 USB-C로 iPhone 17 Pro Max를 연결해 상위 레이어를 폰 GPU에서 돌리면 Qwen 3.8 27B의 프리필 속도가 29~44% 빨라진다.
Ascend 96GB 카드. 96GB짜리 Huawei Atlas 300I Duo 카드 2장으로 Qwen3.8 Flash-Next를 약 30 t/s로 돌릴 수 있다. 소프트웨어 스택을 튜닝한 결과이며, CUDA를 그대로 대체하는 카드는 아니다.
DGX Spark와 5090 가격. Nvidia가 64GB DGX Spark를 내놓았고, 기존 128GB 모델 가격은 6,950달러로 올랐다. Micro Center에서 RTX 5090을 살 때 수출하지 않겠다는 확인서를 요구한다는 얘기도 나온다.
오늘은 여기까지입니다 - 약 5분 읽기 분량.