로컬 모델 및 에이전트 워크로드
Qwen3.8 27B 로컬. 커뮤니티 테스트에서 Qwen3.8 27B가 지시 수행과 긴 문맥 작업에서 Qwen3.6보다 강한 것으로 나타났다. RTX 5090 한 장으로 NVFP4 버전을 실행하면 짧은 문맥에서 77토큰/초, 128K 문맥에서 65토큰/초를 기록한다.
추측 디코딩. DFlash 2는 n-그램 드래프터를 사용해 Qwen3.8 27B의 LiveCodeBench 프롬프트에서 2.26배, 긴 코딩 세션에서 최대 4.68배의 속도 향상을 보였다. Ornith 35B에 고정 MTP 헤드를 적용하면 실제 소요 시간이 3분의 1 줄었다.
재귀 컨텍스트 관리. 개발자들은 빠른 64K 메인 에이전트를 재귀 서브에이전트 및 초소형 압축 모델과 결합해, 300K 컨텍스트 비용 없이 훨씬 긴 작업을 처리하는 중이다.
Gemma 도구 호출 튜닝. 도구 호출과 CLI 사용을 위해 파인튜닝한 Gemma 4 12B는 도구 사용률을 2.7배, 도구 호출 시도를 15.7% 늘렸으며, 16GB VRAM 환경을 대상으로 한다.
DGX Spark 클러스터. 36노드 DGX Spark 클러스터를 에이전트 역량 클러스터로 운영해, SOTA 모델, 리랭크/임베딩, 비디오, 이미지, 오디오 작업에 노드를 동시에 분배한다.
도구 및 프레임워크
llama.cpp 0.2.0. llama.cpp 0.2.0이 프리빌드와 최신 업스트림 변경 사항을 갖춘 로컬 추론용 버전으로 출시됐다.
Cloudflare Kitesurf. Kitesurf는 페이지마다 격리된 DOM을 갖춘 WebAssembly/Rust Workers 기반 에이전트용 브라우저 엔진이다. CDP를 지원해 Playwright와 Puppeteer로 전체 Chromium보다 낮은 오버헤드로 구동할 수 있다.
llm 0.33. Simon Willison의 llm 0.33은 임베딩 모델용 호출별 API 키, 모델 구성과 프롬프트를 결합하는 반복 사용 가능한 템플릿, 추론 모델용 reasoning_summary 옵션을 추가했다.
코딩 에이전트 실무. Simon Willison은 코딩 에이전트의 핵심 역량은 변경 사항을 자신 있게 지시하고 검증하는 것이라고 주장한다. Linus Torvalds는 어려운 디버깅 세션에서 잡일을 처리했지만 문제가 해결 불가능하다고 반복해서 주장해 결국 밀어붙여야 했던 AI를 설명했다.
연구 및 방법론
스킬은 플레이북. 8,135회의 테스트 실행에서 에이전트 스킬은 사실이 아닌 신뢰할 수 있는 프로세스를 제공함으로써 주로 도움이 됐다. 절차적 근거가 성과의 65.7%를 차지했으며, 작업이 학습된 프로세스에서 벗어나면 스킬은 실패했다.
정신적 세계 모델. 새 연구는 MENTIS로 인간의 신념과 의도를 AI 세계 모델에 추가한다. 물리적, 정신적, 사회적 개연성을 모델링하면 인간 행동 예측이 크게 개선된다.
안전 벤치마크 심리측정. 8개 안전 벤치마크에 대한 심리측정 분석 결과, 단일 점수는 거부 엄격성, 진실성, 맥락적 피해 사이의 트레이드오프를 숨긴다. 모델은 과도한 차단으로 안전 점수를 부풀릴 수 있다.
가역적 CoT. 주기 일관성 검사와 계산 되돌리기를 통해 추론 단계를 대략 가역적으로 만드는 제안은 환각을 잡아내고 엣지 LLM의 KV-캐시 메모리를 줄일 수 있다.
모든 게 시뮬레이션. Latent Space는 합성 데이터, 루브릭, 환경 덕분에 ML 파이프라인의 모든 구성 요소가 모델로 만들어지고 있다고 주장한다. 인간 시뮬레이션에 비해 품질은 10% 나쁘지만 비용은 100배 저렴하고 속도는 1만 배 빠른 수준에 근접한다는 것이다.
산업 및 응용
Inherent Faraday. DeepMind 출신들이 만든 스타트업 Inherent는 자사의 Faraday 에이전트가 모델 크기의 일부만 사용하면서도 출판된 과학적 발견을 독립적으로 재현하는 데 있어 Anthropic과 OpenAI 모델보다 뛰어난 성과를 냈다고 밝혔다.
LinkedIn AI 리뷰. LinkedIn은 diff와 코드베이스 규칙에 기반한 피드백으로 환각과 시그널이 낮은 댓글을 줄이는 멀티 에이전트 AI 코드 리뷰 플랫폼을 구축했다.
Netflix GenRec. Netflix의 언어 모델 기반 추천 시스템 GenRec은 사용자 행동을 텍스트로 변환하며, 오프라인 및 라이브 A/B 테스트에서 수작업으로 만든 피처 엔진을 훨씬 적은 데이터로 이겼다.
DoorDash SafeChat. DoorDash는 대규모로 구축된 마켓플레이스 안전 시스템 SafeChat을 상세히 공개했고, 작동하기 시작하자 더 강력한 아키텍처로 교체했다.
교육용 AI 아바타. Harvard Business School의 699달러 Foundry 부트캠프는 피치와 이사회 미팅 피드백에 HeyGen AI 아바타를 사용한다. 참가자들은 안내된 경험을 좋아하지만, 실제 강사는 그 복제본이 조금 섬뜩하다고 말한다.
모델 소식. Liquid AI가 100B LFM 모델에 대한 관심을 조사 중이다. 한편 Ox Alpha라는 미스터리 모델이 강력한 코딩 및 에이전트 성능으로 주목을 받으며, GLM 계열 파생 모델이라는 추측이 나온다.
정책, 안전 및 신뢰
OpenAI SB 53. OpenAI는 이전에 반대했던 SB 53에 대해 캘리포니아가 프런티어 학습 중 모니터링과 강화된 사이버보안을 추가하도록 수정해야 한다고 이제 밝혔다.
격리 계획. Guidelight 연구는 5개 프런티어 연구소의 악성 모델 격리 역량을 평가했다. OpenAI가 가장 높은 점수를 받았고 Anthropic과 Meta가 가장 낮았으며, 입증된 대응 계획을 공개하는 연구소는 거의 없다.
Claude 워터마킹. Anthropic의 Claude 텍스트 출력용 새 워터마킹이 자세히 소개됐다. 워터마크 적용 방식과 가능한 작업 및 불가능한 작업을 다룬다.
폐쇄 모델 신뢰. Reddit r/LocalLLaMA 스레드는 OpenAI가 학업 과제에서 고의로 성능을 낮추고 사용자 권한 강화에서 멀어지고 있으며, 이로 인해 실무자들이 에이전트 루프에 로컬 모델을 다시 사용하게 된다고 주장한다.
오늘은 여기까지입니다 - 약 5분 읽기 분량.