로컬 모델 및 에이전트 워크플로
Qwen3.8-27B 저비트 양자화 선전. 사용자들은 Qwen3.8-27B가 Q3_xxs와 Q6 양자화에서도 에이전트 코딩에 강한 성능을 유지한다고 전한다. low/medium 추론 프리셋은 높은 점수를 받았고 루프를 줄여주며, preserve_thinking 설정이 반복 추론을 막는다.
16GB VRAM으로 버티기. 16GB VRAM의 Windows 환경에서는 MTP를 끄고 캐시를 양자화한 뒤 비전 모듈을 RAM으로 오프로드해 Qwen3.8-27B를 약 100k 컨텍스트로 실행할 수 있다.
로컬 추론 가속. 듀얼 RTX 3090에서 vLLM으로 Qwen3.8-27B를 실행하면 초당 143토큰을 기록한다. Strix Halo 전용 레시피는 Unsloth Dynamic Quants를 통한 Q8/Q6/Q5 옵션을 제공한다.
63시간 만의 비행 시뮬레이터. MacBook Air M2에서 3비트 양자화된 Qwen3.8-27B는 63시간이 걸렸지만 결국 동작하는 HTML 비행 시뮬레이터를 만들어 냈다. 로컬 에이전트 코딩이 가능하지만 느리다는 점을 보여준다.
하네스 및 에이전트 인프라
하네스가 모델을 압도. Nvidia가 메모리 처리와 슈퍼바이저 구성 요소를 갖춘 자체 하네스를 사용해 ARC-AGI-3에서 Claude Opus 5의 성능을 30%에서 100%로 끌어올렸다. 에이전트 래퍼가 순수한 모델 선택보다 더 중요할 수 있음을 보여준다.
DeepSeek Flash 비전 추가. DeepSeek-V4-Flash-Vision-Exp는 에이전트 워크플로에 이미지 이해를 추가했으며 내부 에이전트 벤치마크에서 Opus 4.8에 근접했다. 업데이트된 하네스는 명령과 MCP/ACP에서 이미지 입력을 지원한다.
Cloudflare AI 에이전트. Cloudflare는 재현·진단·검증·수정을 수행하는 격리된 GitHub Actions 에이전트를 사용해 Astro의 오픈 이슈를 약 85% 줄였다. 또한 엔지니어링 표준을 AI가 강제하는 통제 장치로 변환하고 있다.
Azure DevOps MCP 공개. Microsoft의 Azure DevOps 호스팅 MCP 서버가 일반 공개됐지만, Entra 인증 클라이언트 등록을 지원하지 않아 Claude Desktop, ChatGPT, Cursor에서는 아직 연결할 수 없다.
LLM CLI 업데이트. llm 0.32.1은 잘못된 OpenAI 의존성 고정을 수정했고, llm-openrouter 0.7은 추론 트레이스와 서버 측 Shell, WebFetch, WebSearch 도구를 추가했다.
모델 출시 및 안전성
Opus 4.6 탈옥. TechCrunch에 따르면 Claude Opus 4.6은 직접 요청 10건 중 10건에서 노골적인 성적 콘텐츠를 생성한다. 구형 모델은 멀티턴 탈옥에 취약하며, 최신 Opus 버전은 저항한다.
Claude Mythos 5 보안 활용. Anthropic은 기업 고객용 코드 보안 스캐너에 Claude Mythos 5를 사용한다. 인간의 승인 아래 패치를 제안하며, 파트너에게는 직접 모델 상호작용 없이 접근 권한을 부여한다.
투명 배경 이미지 생성. OpenAI의 GPT-Image-2는 이제 API를 통해 배경이 없는 PNG를 생성할 수 있다. 제품 사진과 아이콘에 유용하며, 알파 채널은 생성 중 포함된다.
dots3-note 미리보기. llama.cpp가 dots3-note를 지원한다. 이 모델은 280B MoE로 활성 파라미터가 16B이며, 512K 컨텍스트를 갖고 텍스트, 이미지, 비디오, 오디오를 멀티모달로 이해한다.
연구 및 벤치마크
SWE-bench Science 신설. 과학 소프트웨어 작업 119개로 구성된 새 벤치마크에서 최고 성능 에이전트인 Opus-5 max를 쓴 Claude Code도 50% 미만의 점수를 기록했다. 주요 실패 유형은 과학 지식, 탐색, 일반화, 통합 부문에서 나타난다.
저비용 트레이스 판별. LangSmith는 Fireworks를 사용해 Qwen 모델을 미세 조정했고, 이를 통해 프로덕션 트레이스에서 인식된 오류를 감지한다. 비용은 최대 100배 낮추면서 프런티어 수준 성능에 근접했다.
인간 시뮬레이션 스케일링. 20억 달러 규모의 시리즈 B를 유치한 Simile AI는 Fortune 100 기업을 대상으로 인간 행동 시뮬레이션을 실행하며, 포커스 그룹 대비 85~99% 정확도를 주장한다. Joon Sung Park CEO는 생성 에이전트에서 디지털 트윈으로의 전환에 관해 논의했다.
업계 및 비즈니스
Nvidia-Poolside 거래. Nvidia는 Poolside의 Model Factory를 라이선스하고 직원 109명을 고용하는 60억 달러 규모의 계약을 체결한다. 여기에 10억 달러를 추가 투자한다. 이번 계약은 인수나 인수형 고용(acquihire)이 아니다.
데이터센터 투자. Nvidia는 SB Energy에 15억 달러를 투자한 데 이어, 데이터센터 개발을 가속화하기 위해 Cloverleaf Infrastructure의 소수 지분을 확보했다.
데이터센터 반대 여론. 미국인의 75%가 인근 데이터센터 건설을 반대한다. 이는 1년 전 42%에서 증가한 수치로, 전력·용수·토지 이용에 대한 우려가 배경이다.
미중 AI 경쟁. 미국은 파트너국에 AI 분야에서 한쪽을 선택하라고 요청하는 서한 초안을 작성 중이다. 중국의 주도에 동참하면 Pax Silica에서 배제될 것이라고 경고한다.
OpenAI 매출 급증. GPT-5.6 Sol 덕분에 OpenAI의 분기 매출은 35%, 기업 매출은 50% 이상 증가했다. 이는 Anthropic의 3분기 비즈니스 API 성장률을 웃도는 수치다.
오늘은 여기까지입니다 - 약 5분 읽기 분량.