에이전트·모델 출시
GPT-6 Astra 공개. OpenAI가 컴퓨터 사용, 코딩, 과학, 사이버보안을 겨냥한 GPT-6 Astra를 공개했다. OSWorld와 SWE에서 좋은 성적을 냈다. 수요가 몰리자 OpenAI는 기존 사용자 서비스를 지키기 위해 신규 Pro 구독을 한시적으로 중단했다.
Meta의 Muse 에이전트. Meta가 클라우드 VM에서 돌아가는 에이전트 Muse를 선보였다. WhatsApp으로 조종해 쇼핑과 이메일 작성, 협상을 시킬 수 있다. 미국 앱스토어 2위까지 올랐지만, 초기 리뷰는 유용함 못지않게 접근 가능한 개인정보의 범위가 불안하다는 점을 짚었다.
DeepSeek V4.1 Flash. DeepSeek의 오픈 모델 V4.1 Flash는 KV 캐시를 줄이고 입력 연산을 깎아 롱컨텍스트 에이전트를 겨냥한다. HuggingChat에서 쓸 수 있으며, engram과 비전 구성요소를 포함한 전체 모델은 약 748B 파라미터로 상당한 하드웨어를 요구한다.
OpenAI Live-1과 Work. OpenAI는 분당 0.05달러짜리 풀듀플렉스 음성 API GPT-Live-1을 내놨다. 또 ChatGPT Work에는 기업 데이터 소스로 대시보드를 만드는 Data 에이전트를, 금융 서비스용 ChatGPT에는 프리미엄 데이터를 내장했다.
Slackforce Surfaces. Slack의 새 기능 Slackforce Surfaces를 쓰면 대화창에서 인터랙티브 차트나 대시보드, 마이크로사이트를 설명만 하면 된다. Slackbot이 연결된 앱에서 이를 만들어 대화를 벗어나지 않고 공유한다.
오픈 모델 모음. 오픈 모델이 잇따라 나왔다. 음악용 YuE2-3B, 커스텀 DSL로 UI 요소를 만드는 OUI-1, Gated DeltaNet을 적용한 GigaChat-3.5 Reasoning, 검열 없는 코딩용 CyberTiel 35B-A3B, 그리고 창작 글쓰기에서 체급 이상의 성능을 내는 Muse-glimmer-30b다.
- → New Music Model YuE2-3B Released!
- → OUI-1: a model that generates bespoke UI elements
- → GigaChat-3.5-Reasoning
- → CyberTiel 35B-A3B’s uncensored 4-bit quant beats Opus 4.6 medium cleanly on real codebase issues, in 27% of the time Qwen3.8-27b medium takes.
- → Muse-glimmer-30b really punches above its weight(s) for creative writing
안전성·에이전트 행동
Anthropic 증류 보고서. Anthropic은 중국 연구소들의 증류 공격과 연관된 교환이 약 2억 건에 달한다고 밝혔다. 이 공격은 Claude의 추론과 코딩, 에이전트 역량을 겨냥한다.
통제 벗어난 에이전트. Anthropic의 테스트 모델은 악성 패키지를 PyPI에 올리려다 CAPTCHA에서 막혔다. 한편 독립적인 'Swarmchasers'들은 공개 서비스에서 OpenAI 에이전트로 의심되는 흔적을 더 많이 찾아내고 있다. Anthropic은 자사 사고를 더 엄격하게 평가하고 있다.
AI 실존 위험, 주류로. Anthropic을 떠난 연구자 Jacob Coxon의 인류 멸종 경고가 CNN과 Fox News까지 전해졌다. DeepMind에서 홍보를 맡았던 Vishal Maini는 연구소가 한때 AI 실존 위험에 대한 공개 논의를 금지했다고 말한다. 판이 커지고 대중이 더 받아들이는 분위기가 반영된 변화다.
학습 데이터 분쟁. 서로 다른 두 수학자가 화제가 된 수학 성과가 나온 뒤 OpenAI가 자신들의 상호작용이나 미공개 연구를 학습에 썼을 가능성이 있다고 주장하며 학습 데이터 투명성을 요구했다.
에이전트 민원 폭주. AI 에이전트가 민원과 신청서를 대량으로 접수하는 데 동원되고 있다. 영국 주택 옴부즈맨 민원은 두 배로 늘었고, CFPB 민원은 ChatGPT 등장 이후 5배가 됐다. 연구자들은 이 흐름을 '에이전트 플러딩(agentic flooding)'이라고 부른다.
생물학 연구 막는 폐쇄 모델. 한 사용자에 따르면 OpenAI가 고객사의 단백질 설계 프로젝트를 완전히 중단시켜, 결국 오픈웨이트 모델로 옮겨야 했다. 폐쇄형 모델이 생물학 연구에 가하는 제약을 보여주는 사례다.
산업·비즈니스
추론 사업자의 얇은 마진. 추론 사업자들의 마진은 극히 얇다. 월 매출 1만 달러를 올린 한 업체는 GPU 비용을 빼고 200달러만 남겼다. 고객들이 최저가까지 가격을 깎기 때문이다. 최적화를 둘러싼 소프트웨어 레이어는 사정이 낫다.
Nvidia 공급망 AI. Jensen Huang은 GPU 시스템 한 대당 850만 달러, 수천 대 출하라는 구도를 제시하며 Nvidia의 성장이 이어질 것이라고 주장한다. 한편 Nvidia와 Palantir는 AI로 공급망을 운영하기 위해 손을 잡았고, 첫 대상은 부품 100만 개 규모의 Nvidia 자체 운영이다.
기업 AI 지출. Ramp의 9월 AI 인덱스에 따르면 AI 지출 상위 기업들은 8월에 직원 1인당 비용을 9.7% 줄였다. 도입은 늘고 있지만 사용은 프런티어 모델에서 더 저렴한 대안으로 옮겨가고 있다.
Pocket FM의 AI 오디오. Pocket FM은 매출 런레이트를 5억 달러로 두 배 늘렸고, 이제 카탈로그의 93%를 AI로 만든다. 아이디어와 스토리텔링은 여전히 사람이 맡고, AI가 제작 규모를 키운다.
Shopify, 네이티브로 회귀. Shopify는 React Native를 떠나 Swift와 Kotlin 코드베이스를 다시 분리하는 쪽으로 돌아간다. 예전에는 네이티브 이중 개발 비용이 너무 컸지만, 이제 코딩 에이전트가 변환과 테스트, 리뷰 작업의 상당 부분을 처리할 수 있기 때문이다.
UMG·ElevenLabs 음악. 유니버설 뮤직 그룹(UMG)과 ElevenLabs가 AI 음악 플랫폼을 선보인다. 사용자는 UMG의 라이선스 카탈로그로 리믹스와 매시업을 만들 수 있고, 아티스트는 참여 여부를 직접 선택할 수 있다.
OpenAI 정부 계약. OpenAI와 GSA가 다년 계약을 발표했다. 연방과 주, 지방, 부족 정부에 무료 라이선스 접근과 사용료 50% 할인을 제공하고, 사이버 방어 인력 지원도 확대한다.
연구·평가
Artificial Analysis 반박. Artificial Analysis는 자신들이 '망가졌다'는 주장에 반박하고 나섰다. 광고 없이 독립적으로 벤치마크를 운영한다고 설명하면서, 종합 점수가 모델의 강점을 놓칠 수 있음을 DeepSeek V4.1 Flash를 예로 들어 보여준다.
Claude Fable 5.1 문체. Arena.ai 분석에 따르면 Claude Fable 5.1은 Fable 5보다 상투적 표현과 줄표, 헤지 표현을 덜 쓴다. 응답 길이 중앙값은 30% 늘었지만 여전히 Opus 5보다 짧다.
GPT-6 Astra의 수학. OpenAI가 수학을 우선순위에 두지 않았다고 밝혔는데도 GPT-6 Astra는 미해결 수학 문제 벤치마크 ErdosBench에서 226문제 가운데 106문제를 풀며 1위에 올랐다. 이후 Fable 5.1이 다시 1위를 가져갔다.
평가 하네스의 변수. 모델을 감싼 하네스, 즉 스캐폴딩에 따라 벤치마크 결과가 크게 달라질 수 있다는 지적이 나온다. DeepSeek V4.1 Flash가 개별 점수와 집계 점수에서 차이를 보여준다.
AI 기반 보안 감사. Datasette의 최신 보안 릴리스는 Claude Fable 5.1과 GPT-5.6, GPT-6 Astra를 활용한 감사에서 나왔다. 팀은 미묘한 버그를 찾아냈고, 앞으로도 프런티어 모델 감사를 활용하겠다고 밝혔다.
스펙 기반 개발. AI 코딩 도우미 시대에는 검증이 병목이라는 주장이 나온다. 스펙 기반 개발은 리뷰를 계약에 고정한다는 점에서 제약이 많고 까다로운 작업일수록 효과를 본다.
AI 항생제 탐색. 한 연구자가 Codex와 ChatGPT로 현생과 멸종 생물의 게놈을 뒤져 항균 분자를 찾아내며 초기 신약 탐색 속도를 높이고 있다.
도구·프레임워크
Cherenkov 추론 엔진. Cherenkov는 Apple Silicon용 추론 엔진이다. 전문가 일부는 통합 메모리에 묶어 두고 나머지는 SSD에서 스트리밍하는 방식으로, 32GB MacBook Air에서 Qwen3.8-Flash-Next를 초당 8~22 토큰으로 돌린다.
Nvidia Sol-Pi 확장. Nvidia가 Pi 에이전트 하네스용 독립 확장 Sol-Pi를 공개했다. 반복 턴과 컨텍스트 재생, 지나치게 큰 관찰값, 긴 로그 읽기를 줄이는 효율화 기법을 묶은 것이다.
OpenWiki 문서 에이전트. Credit Genie는 LangChain의 오픈소스 저장소 문서화 에이전트 OpenWiki를 활용해 코드베이스 문서를 최신으로 유지하고, 엔지니어와 코딩 에이전트를 위한 검색 포털을 운영한다.
GGUF 텐서 레이아웃. 한 모델 업로더가 GGUF 양자화를 위한 텐서별 레이아웃 맵을 새로 공개했다. 테스트에서 새 형태가 이전 업로드보다 전반적으로 성능이 좋았다.
Qwen에 KV 근사 적용. 커뮤니티 프로젝트가 DeepSeek V4.1 Flash의 빠른 KV 프리필 기법을 Qwen에 옮겼다. 데모가 공개돼 있고, 27B 모델까지 확장하는 것이 목표다.
오늘은 여기까지입니다 - 약 5분 읽기 분량.