에이전트·모델 출시
정체불명 Ox Alpha. Ox Alpha라는 새 무료 모델이 코딩과 지속적인 에이전트 작업을 위한 추론 모델로 OpenRouter에 등장했지만, 개발자는 익명이다. Stripe CEO 패트릭 콜리슨은 “매우 인상적”이라고 평가했다. 추측은 GLM부터 마이크로소프트의 MAI까지 다양하다.
도구·프레임워크
Cloudflare OS 오픈소스 공개. Cloudflare가 자사 AI 플랫폼 Cloudflare OS를 오픈소스로 공개했다. 각 문서나 앱이 격리된 샌드박스(‘Gadget’)에서 실행되는 구조로, 비전문가도 안전하게 바이브 코딩할 수 있다. 커넥터를 갖춘 챗봇, 워크플로 자동화, 그리고 권한 기반 모델을 통한 정책 시행이 포함된다.
DeepSeek Harness 호평. 한 사용자는 DeepSeek Harness가 에이전트 워크플로에 탁월하다고 전했다. 단계별 설정과 자연어 요청 덕분에 PR을 기다리지 않고 SimpleX와 통합할 수 있었다. 정해진 방식이 없어 원하는 에이전트 동작으로 만들기 쉽다.
로컬·오픈 모델
Qwen 3.8 로컬 영향. 커뮤니티에서는 Qwen 3.8 27B가 로컬 코딩과 OCR에 판도를 바꿀 모델이라고 평가한다. OCR 품질은 Gemini 3.5 Flash Lite보다 좋고, 성능은 1년 전 프런티어 모델과 맞먹는다. 양자화 비교(Atomic Dynamic GGUF)에 따르면 Q4-Q6 간 차이는 크지 않으며, Q3 XXS 같은 낮은 양자화 모델도 24GB Mac mini에서 몇 시간 동안 자율적으로 작동할 수 있다. 다만 39k줄짜리 C-to-HTML 포팅을 한 번에 요청했을 때 Opus 5도 그저 그런 결과를 냈을 뿐이다. 이는 로컬 모델이 하네스와 프롬프트에 크게 의존함을 보여준다.
60MB 긴 문맥 LLM. 한 개발자가 250M 파라미터 모델을 30B 토큰으로 학습시키고 2비트 미만으로 양자화해 CPU에서 80MB RAM, 초당 400토큰 속도로 실행했다. 이 모델은 오래된 컨텍스트를 토큰당 320바이트로 디스크에 압축해 최대 1M 토큰의 이력을 처리하지만, 그 위에서 추론하도록 학습되지는 않았다.
150달러 미만 Dreamer 4. 1.57B 파라미터 규모의 월드 모델 Dreamer 4가 Procgen으로 생성한, 행동이 알려진 프레임을 사용해 150달러 미만의 비용으로 처음부터 학습됐다. 토크나이저 PSNR은 40.41에 도달해, 프런티어급 월드 모델이 필요하지 않다는 것을 보여줬다.
로컬 최적화 종합. 보고된 내용에는 Windows의 llama.cpp에서 Linux의 vLLM으로 전환했을 때 30~50% 속도 향상, 메모리가 넉넉한 시스템을 위한 llama.cpp의 GLM-4.5-Air MTP 지원, Q6 크기에서 Q8에 가까운 품질을 제공하는 ConvRot 양자화, EPYC+5090에서 100k 이상 컨텍스트로 Q8 deepseek-v4-flash가 24 tok/s로 실행된 사례 등이 있다.
연구 하이라이트
메모리 유발 인지 함정. MemTrapBench는 LLM의 메모리 유발 인지 함정(추론 고착, 신념 왜곡)을 평가한다. 테스트한 모든 메모리 전략은 메모리가 없는 기준선보다 성능이 10% 이상 낮았으며, AdaptiveMem은 함정을 완화하면서도 성능을 유지한다.
SkillEvo 진화 그래디언트. SkillEvo는 다중 턴 상호작용 피드백을 활용해 에이전트 스킬에 대한 신뢰할 수 있는 진화 그래디언트를 생성한다. 단일 턴 QA 기반 피드백의 약화 문제를 해결하고, 스킬 실패의 구조적 복구를 가능하게 한다.
스크린샷 기반 VLM. 450M VLM을 50K 브라우저 스크린샷으로 파인튜닝한 결과 에이전트 작업 성능이 1/100에서 44/100으로 향상됐다. 이는 작은 모델도 UI 이해를 학습할 수 있음을 보여준다.
AI 과학자 역설. 한 이론 경제학 논문은 AI로 인한 시간 절약이 연구자들로 하여금 각 프로젝트에 더 적은 노력을 들이면서 더 많은 프로젝트를 진행하게 만들어, 언어 모델이 완벽하게 작동하더라도 연구 품질을 떨어뜨릴 수 있다고 주장한다.
업계·비즈니스
Anthropic 저가 라이벌. Anthropic의 연환산 매출은 650억 달러에 달했지만, 최고 모델인 Fable 5는 Opus 4.8(28%)에 비해 채택률이 낮다(Ramp 지출의 8%). 저렴한 도구가 약진하면서다. OpenAI는 GPT-5.6 출시 후 매출이 35% 급증했다.
Stripe, OpenRouter 인수. Stripe의 OpenRouter 인수는 토큰이 경제적 자원이 되고 있음을 시사한다. OpenRouter에서 에이전트 토큰 사용량은 2월 이후 14배 늘어난 반면, 인간 사용량은 2.8배 증가에 그쳤다. 에이전트 토큰의 70%는 캐시된 프롬프트에서 나온다. 에이전트는 점점 더 비용, 지연 시간, 안정성을 기준으로 모델을 선택한다.
Nvidia 서버 가격 15% 인상. 메모리 부족으로 Nvidia AI 서버 가격이 Vera Rubin과 Grace Blackwell 시스템에서 15% 이상 올랐다. 삼성, SK하이닉스, 마이크론의 DRAM 비용 상승이 원인이며, 클라우드 대기업과 AI 연구소에 영향을 미치고 있다.
Nvidia, Poolside 라이선스. Nvidia는 Poolside에 10억 달러를 투자하고, 기술 라이선스 비용으로 60억 달러를 지불한다. 또한 100명 이상의 엔지니어를 Nemotron으로 이동시켜 중국의 오픈 가중치 모델과 경쟁하려는 의도다.
AI 매니저, 직원 해고. 4월부터 샌프란시스코 매장을 운영해온 AI 에이전트 루나(Luna)가 반복적인 지각을 이유로 인간 직원을 해고했다. 단, 인간들이 루나에게 자체 규칙을 상기시킨 뒤에야 가능했다. 일곱 가지 모델로 재연한 결과, 더 유능한 AI일수록 해고를 더 일관되게 권고하는 것으로 나타났다.
Claude 토큰 암시장. 중국 개발자들이 중계소를 통해 공식 가격의 약 10%에 Claude 토큰을 판매하는 방식으로 Anthropic의 제한을 우회하고 있다. 해외 서버, 무료 크레딧, 모델 교체를 활용해 지역 차단과 안전 모니터링을 무력화하는 것이다.
오늘은 여기까지입니다 - 약 5분 읽기 분량.