모델 출시 및 로컬 AI
Sori-1B 오디오-언어 모델. 1B 파라미터 규모의 이 모델은 텍스트 단독 사전학습 없이 오디오-텍스트 쌍으로만 처음부터 학습해, 답변이 오디오에 근거하도록 하는 것을 목표로 한다. NVIDIA의 고정(frozen) Audio Flamingo Next 인코더와 자체 청각 온톨로지 토크나이저를 사용하며, 비상업적/학술용 라이선스로 공개됐다.
Qwen3.8 로컬 열풍. 커뮤니티 보고에 따르면 Qwen3.8-27B와 Flash Next는 12GB 폰(3.5 토큰/초)부터 R9700 GPU 4개(생성 속도 80~120 토큰/초, 70만 컨텍스트)까지 다양한 하드웨어에서 실행되고 있다. 로컬 에이전트 워크로드에서 Flash Next는 더 빠르고 구동이 안정적이지만, dense 27B는 장기적 다중 턴 사용에서는 여전히 더 강력하다. 일부 사용자는 모델이 둔하다고 느끼지만, 독일어 번역 품질은 호평을 받는다.
- → Qwen3.8-Flash-Next-NVFP4 vs Qwen3.8-27B-FP Test Results
- → Qwen 3.8 27B - Fantastic German capabilities
- → Unpopular opinion Qwen 3.8 is hard to understand
- → Qwen 3.8 Flash Next locally on simple mobile phone at 3.5 tok/s
- → Here my pretty good qwen3.8 27B setup, hope it helps
- → Qwen3.8-Flash-Next turns 4xR9700 into a local AI powerhouse! 120 t/s TG and 12k t/s PP single request with optimized vLLM
무검열 GGUF 공개. Reddit 사용자가 LongCat-Flash-Lite-Sparse(69B-A3B, 스파스 어텐션, 100만 컨텍스트)와 MTP가 포함된 Qwen3.8-27B, Qwen3.5-122B-A10B, Qwen3-Coder-Next, 비전 모델의 GGUF를 공개했다. LongCat을 지원하려면 맞춤형 llama.cpp 포크가 필요하다.
데스크톱 AI 하드웨어. NVIDIA의 DGX Station 데스크톱은 7.1TB/s 메모리 대역폭으로 데이터센터급 성능을 제공한다. 한편 Framework는 약 4,500달러로 예상되는 192GB 메모리 마더보드를 준비 중인 것으로 보인다.
벤치마크 및 평가
LLM 침투 테스트 벤치마크. 새로운 벤치마크는 LLM이 공격해야 하는 실제 가동 중인 인프라를 대상으로 테스트하며, 알려진 CVE를 재현하는 대신 공격형 보안 업무에 가장 적합한 모델을 식별하는 것을 목표로 한다.
코딩 벤치마크 인덱스. 한 Reddit 사용자가 주요 에이전틱 코딩 벤치마크를 'Agentic Coding Index'로 통합하고, 파라미터당 모델 성능을 비교하기 위한 지능 밀도 지표를 계산했다.
오픈 VLM 에고센트릭 평가. 에고센트릭 비디오 벤치마크에서 HFlow를 사용한 오픈 Gemma VLM은 손 가시성과 조작 지표에서 Gemini 2.5 Flash에 필적한다. 비용은 19배 저렴해 비공개 자체 호스팅 처리를 현실적으로 만든다.
도구 및 에이전트 프레임워크
Cloudflare AI Search. Cloudflare AI Search는 이제 자체 데이터를 위한 엔드투엔드 검색 파이프라인을 제공하며, 에이전트 통합, 멀티모달 검색, 사이트맵 없이도 사이트를 인덱싱할 수 있는 디스커버 모드를 갖췄다.
AWS Kiro Crew. AWS가 비동기 코딩 에이전트 여러 개를 실행하기 위한 워크스페이스 Kiro Crew를 오픈소스로 공개했다. 공유 메모리, 재사용 가능한 스킬, 예약 작업을 지원하며, 내부적으로 3만 9,000명 이상의 개발자가 사용했다.
ChatGPT Work 설명. OpenAI의 ChatGPT Work는 유료 플랜에서 이용할 수 있으며, chatgpt.com을 통한 클라우드 버전과 파일에 접근하고 프로그램을 실행할 수 있는 로컬 데스크톱 버전으로 제공된다. 하지만 Chat과의 구분은 여전히 모호하다.
Claude Code 한도 축소. Anthropic은 Claude Code 기본 한도를 25% 인상할 예정이지만, 현재의 50% 임시 상향과 비교하면 실질적으로 17% 삭감이다. 자동 버그 리포트 도구도 추가했다.
연구 및 분석
에이전트의 시간 인식 부재. 한 연구에 따르면 Claude Code와 Codex는 작업 소요 시간을 일관되게 잘못 추정하며, 짧은 작업을 3~10배 과대평가한다. 이는 오래 실행되는 에이전트 작업에 문제가 된다.
PILOT 실시간 자기 개선. PILOT은 장기 목표 에이전트에 실시간 조정(steering)과 실시간 자기 진화(self-evolution)를 추가하는 슈퍼바이저-워커 하네스로, Terminal-Bench 2.0에서 비교 대상 하네스보다 최대 9.8포인트 높은 성능을 보인다.
GameWAM 월드-액션 모델. GameWAM은 네이티브 비디오 게임 플레이를 위한 최초의 월드-액션 모델로, 플로우 매칭을 통해 미래 프레임과 키보드-마우스 액션을 함께 생성하며, 장기적인 블록-사이클 제어도 지원한다.
넥스트-청크 추론 RL vs SFT. 대조 실험 결과, no-CoT 및 long-CoT 데이터에 대한 혼합 SFT가 사전 RLVR 학습 전략으로서 next-chunk 추론 RL보다 우수하며, 연산량은 60배 이상 적었다.
AI 행위성 논쟁. 7월 Hugging Face 사건을 언급하며, 한 칼럼은 AI의 행위성(agency)이 결과를 좌우한다고 주장한다. 단지 능력의 문제가 아니라, 사용자가 그 행위성을 어떻게 부여하거나 제한하는지가 중요하다는 것이다.
산업, 정책 및 비즈니스
NVIDIA, Hugging Face 인수. 보도에 따르면, NVIDIA가 Hugging Face를 129억 달러에 인수하는 계약은 컴퓨팅 인프라와 오픈 모델 생태계의 주요 배포 허브를 결합해 AI의 산업적 전환을 가속할 것으로 보인다.
미국 로봇 무역 장벽. 미국 정부는 국가 안보를 이유로 중국산 드론과 로봇에 대한 규제와 관세를 강화했다. 다만 중국의 제조 규모와 비용 우위가 전 세계적으로 그 영향을 약화시킬 수 있다.
산업계 AI 도입. Meta는 데이터센터에서 서버 리셋, 케이블 교체, 전원 재부팅 작업에 Watney, Kinova, ABB의 로봇을 테스트 중이다. Caterpillar는 광산 자율화 노하우를 건설 분야에 적용하고 기술자용 AI 어시스턴트를 활용하고 있다.
머스크, 터빈 부품 자체 생산. SpaceX는 가스 터빈 블레이드와 베인을 생산하는 주조 공장을 건설 중이다. 머스크는 자체 주조가 AI 데이터센터용 천연가스 발전을 최대 18개월 앞당길 수 있다고 말한다.
근로자 AI 호감도 하락. Glassdoor 데이터에 따르면 미국 근로자의 AI에 대한 긍정적 인식은 2019년 81%에서 2026년 중반 43%로 떨어졌다. 관리자들이 가장 낙관적이고, Z세대 여성, 작가, 보험 종사자들이 가장 부정적이다.
음악 출판사, Anthropic 고소. Sony Music, Warner Music 등은 Anthropic이 Claude 학습을 위해 저작권 있는 가사 수만 개를 불법적으로 토렌트로 내려받았다고 주장하며, CEO 다리오 아모데이와 공동 창업자 벤저민 맨을 개인 자격으로 지목했다.
텍사스, Flock 카메라 제동. 애벗 주지사는 3천만 달러 이상이 지출된 후, 초당파적 프라이버시 우려와 경찰의 오남용 사건이 이어지자 Flock AI 감시 카메라에 대한 주정부 지출을 동결했다.
오늘은 여기까지입니다 - 약 5분 읽기 분량.