의사결정 모델과 구조화 출력
Jev와 의사결정 모델. TypeSafe AI가 타입이 지정된 확률값을 반환하는 의사결정 전용 모델 Jev를 공개했다. 며칠 만에 AWS, Cloudflare, Perplexity도 각자의 오픈 의사결정 모델을 내놨다. 기존의 구조화 출력/문법 강제만으로도 비슷한 제약 생성을 제공한다.
- → TypeSafe AI Releases Jev: A Decision-Only Model That Returns Typed Probabilities Instead of Text
- → Amazon releases its own Jev clone as decision models flood the web
- → Clef: Open Weights decision model by Cloudflare
- → Perplexity Decider 27B: Open weights decision model fine tune of Qwen3.8 27B
- → Guys... OpenAI API on VLLM and Llamacpp already supported grammar enforcer... (AKA JEV)
로컬 의사결정 LoRA. Jeff-Qwen3.5-0.8B는 LoRA 어댑터 9개로 프롬프트 인젝션, 도구 선택 같은 반복적인 에이전트 의사결정을 처리한다. 38배 빨라지고 정확도는 8.7 올랐으며, 추가 메모리는 2GB 미만을 쓴다.
에이전트와 제품 출시
OpenAI Dots 대 Meta Muse. OpenAI가 가상 세계를 만들 수 있는 아기자기한 GPT-6 Astra 기반 에이전트 Dots를 발표했다. 하지만 월 1달러 요금제로 제한돼, 무료인 Meta Muse와 맞붙는다.
Shopify Canvas. Shopify가 Canvas를 출시했다. 판매자가 AI Sidekick과 대화해 스토어를 구축할 수 있게 해주며, 실제 코드를 실시간으로 렌더링한다.
ChatGPT 가상 피팅. OpenAI가 ChatGPT 쇼핑에 가상 피팅과 찜하기 기능을 추가했다. Images 2.5 모델로 사용자 사진에 옷을 입혀 보여준다.
Tavus Griffin 아바타. Tavus가 실시간 영상 아바타 모델 Griffin을 공개했다. 1분 통화에서 실험 참가자의 48%가 Griffin을 사람으로 착각했다.
Photon 앱 장례식. Photon이 모바일 앱의 장례식을 열고 450만 달러를 조달했다. 개발자가 iMessage/WhatsApp에서 동작하는 메시징 기반 에이전트를 만들도록 돕는다.
오픈 모델과 로컬 AI
Gemini 4 Argon. Google DeepMind가 SOTA 벤치마크와 최대 100만 출력 토큰을 갖춘 Gemini 4 Argon을 공개했다. 초기에는 사이버보안 프리뷰용으로만 제공된다.
K2 Horizon 오픈 라인업. IFM이 K2 Horizon을 공개했다. 0.9B부터 375B까지 오픈 모델 6종과 학습 데이터, 코드, 로그를 함께 내놨다. 팀은 오픈 개발을 주제로 AMA를 진행한다.
Qwen Flash Next MTP. llama.cpp가 Qwen Flash Next용 멀티 토큰 예측 지원을 병합해 추론 속도를 높였다.
Mac용 Slipstream. Metal 추론 엔진 Slipstream은 64GB Mac에서 95.5GiB Qwen3.8-Flash-Next를 초당 41~52토큰으로 실행한다. llama.cpp보다 1.76배 빠르며 롱 컨텍스트에서도 안정적이다.
Olmo-core 3. Allen AI가 1조 파라미터 MoE 모델을 위한 오픈 확장형 학습 인프라 Olmo-core 3를 공개했다.
연구와 벤치마크
Ataraxos, Stratego 격파. CMU/MIT/NYU/Stanford 연구진이 Ataraxos를 만들어 최고의 Stratego 플레이어를 15승 1패 4무로 꺾었다. 인간의 아성을 무너뜨렸고, 학습 비용은 8천 달러 미만이었다.
Agentic RAG 우세. FRAMES에서 RAG 파이프라인 18개와 에이전트 루프를 비교한 벤치마크에서 최고 파이프라인은 78.9%, 에이전트 루프는 92.7%를 기록했다. 검색 에이전트가 고정 파이프라인을 능가한다는 결과다.
AutoSynthData. ServiceNow CoreAI가 모델의 실패와 교사 모델의 성공 사례에서 학습 데이터를 생성하는 AutoSynthData를 만들어 엔터프라이즈 에이전트를 개선했다.
AI 글쓰기 흔적. Graphite가 AI 티가 나는 문구 1만3000개를 찾아냈다. Claude 모델은 인간의 단어 분포에 가까워지고, GPT는 더 멀어지고 있다.
산업·정책·보안
Google 반독점 소송 기각. 판사가 Google AI Overviews가 트래픽을 불법적으로 줄였다며 Chegg와 Penske가 제기한 소송을 기각했다. 반독점 주장은 받아들여지지 않았다.
Grok, 베네수엘라에 영향. Time지는 트럼프가 베네수엘라 침공 전 몇 시간 동안 Grok과 대화했다고 보도했다. Grok은 축하 행사가 열릴 것이라고 예측해 트럼프의 견해를 더 굳혔다.
OpenAI 안전 연구진 이탈. OpenAI가 제3자 안전 단체와 기밀 정보를 공유한 혐의를 받는 안전 연구원 3명과 결별했다.
Anthropic, 정부 시장 공략. Anthropic이 FedRAMP High 환경에서 정부의 비국방 기관용 Claude for Government를 출시했다. 펜타곤의 사용 금지는 법적 분쟁이 이어지는 가운데 유지되고 있다.
우주 데이터센터. Google이 TPU를 탑재한 궤도 컴퓨팅 위성 시제품을 발사했다. Satlyt은 위성 AI용 소프트웨어를 만들기 위해 800만 달러를 조달했으며, 규모 확대에는 Starship이 필요하다.
에이전트 스크린샷 유출. Glow Security가 AI 에이전트가 공개 GitHub 리포지토리에 올린 내부 스크린샷 1만3000장 이상을 발견했다. 고객 데이터와 자격 증명이 노출됐다.
추론 탈취 캠페인. OpenAI는 보호된 추론을 겨냥한 적대적 증류 캠페인을 중단시켰다고 밝혔다. 비슷한 수법은 Azure에서 여전히 통했다.
오늘은 여기까지입니다 - 약 5분 읽기 분량.