에이전트 및 모델 출시
Claude Fable 5.1. Anthropic이 Fable 5.1과 Mythos 5.1을 출시했다. 코딩·리서치 성능이 개선됐고, 저렴한 캐시 읽기를 통해 에이전트 작업 비용이 최대 45%까지 낮아진다고 회사 측은 밝혔다. 제한 없는 버전의 Fable 5.1은 지금 사용할 수 있지만, 초기 비용 분석에서는 최고 추론 설정에서의 최대 절감 효과에 의문을 제기한다.
- → Claude Fable 5.1 made me a really nice animated pelican
- → Anthropic launches Claude Fable 5.1 and says it’s up to 45 percent cheaper for agentic work
- → Anthropic's Claude Fable 5.1 promises better coding and research at up to 45 percent less
- → Anthropic’s new Fable release is cheaper, less restrictive
OpenAI Astra 롤아웃. OpenAI는 곧 공개할 Astra 모델이 자사 핵심 사이버보안 기준을 충족한 첫 LLM이라고 밝혔다. 이 모델은 알려지지 않은 취약점을 자율적으로 찾아 악용할 수 있다. 회사는 Hugging Face 해킹 이후 안전장치를 강화하기 위해 Astra 개발 일부를 지연했고, 가장 진보된 사이버보안 기능에 대한 접근도 제한할 방침이다.
새 Spark-X2.5 모델. 오픈 모델 Spark-X2.5-4B와 1.7B가 새로운 아키텍처를 갖추고 Hugging Face에 등장했다. Qwen 3.5 9B에 견줄 만한 성능과 기본 1M 컨텍스트를 제공한다고 주장한다. 아직 공식 llama.cpp에서는 실행되지 않지만 맞춤형 포크가 준비돼 있다.
Runway Solaris 인터페이스 모델. Runway는 코드를 실행하는 대신 클릭과 음성에 반응해 UI 프레임을 실시간으로 생성하는 '인터페이스 월드 모델' Solaris를 공개했다. 텍스트 렌더링과 스크린 리더 지원에 한계가 있는 연구 단계 프로젝트다.
로컬 AI 및 하드웨어
Qwen3.8 커뮤니티 보고. 커뮤니티 보고에 따르면 Qwen3.8 27B와 Flash-Next가 다양한 하드웨어에서 실행되고 있다. 48GB Mac에서는 12tok/s를, 듀얼 Epyc R9700s에서는 MXFP4 커널로 280tok/s 디코딩을, RTX 3090 단일 카드에서는 커스텀 최적화 후 132tok/s 디코딩을 기록했다. 양자화 벤치마크는 16GB 카드에 UD Q3_K_XL이 잘 맞는다는 것을 시사한다. 일부 사용자는 Qwen3.8이 코딩 능력은 좋지만 코드를 지나치게 고치려 한다고 평가한다.
- → Running 104GB Qwen3.8-Flash-Next on 48GB Mac at ~12 tok/s
- → How I got 280 tok/s on Qwen3.8 27B on 2xr9700's and 940k tokens kv cache
- → I pushed Qwen3.8-27B to 2.000 prefill per second and 132 decode per second on A RTX 3090.
- → Kaitchup posted Qwen3.8 27B Benchmarks for quants from Q4 to Q1
- → Everyone is t/s maxing.. 3.8.. but after a week of using it for work I'm tempted to switch back to 3.6
DGX Spark 가격 인상. Nvidia의 DGX Spark와 Asus Ascent GX10의 가격이 크게 올랐다. Asus 모델은 $3,999에서 $5,999로 뛰었다. 구매자들은 DGX Spark 클러스터가 더 높은 메모리 대역폭을 갖춘 AMD Epyc 시스템과 비교해 비용 대비 효과가 있는지 의문을 제기한다. 다만 DGX는 FP4 지원과 텐서 병렬 처리를 제공한다.
CMP 170HX 고장. 한 사용자는 CMP 170HX GPU 5개 중 2개가 2주 안에 고장 났고, 또 하나는 텐서 코어에 결함이 있었다고 보고했다. 현재 가격만 놓고 보면 LLM 추론을 위해 감수할 리스크가 아니라는 지적이다.
INT8과 양자화 표기 문제. 커뮤니티에서는 RTX 3090이 기본 INT8 텐서 코어를 갖췄는데도 INT8 W8A8 모델이 더 널리 쓰이지 않는 이유를 두고 논의가 이어지고 있다. 또 다른 사용자는 AtomicChat이 IQ2_S 양자화 모델을 Q4_K_M으로 잘못 표기했다고 비난했다.
Intel 메모리 재진출. Intel이 메모리 사업에 재진출할 뜻을 내비쳤다. CEO는 SK Hynix 전임 임원 이석희 영입과 새로운 메모리 아키텍처를 언급했지만, 구체적인 내용은 알려지지 않았다.
도구 및 프레임워크
OpenClaw 2.0 출시. 오픈소스 개인 AI 에이전트인 OpenClaw 2.0이 출시됐다. 기존 ChatGPT/Claude 구독과 로컬 모델을 감지해 설정을 간소화하고, 브라우저를 기본 인터페이스로 재구축했다. 협업을 위한 공유 클라우드 세션도 추가됐다.
Codex 로컬 툴. OpenAI의 Codex 데스크톱 앱 런타임에는 이제 LibreOffice 전체 설치본과 Poppler, git 같은 바이너리가 포함된다. 외부 의존성 없이 문서 처리 스킬을 실행할 수 있다.
AI 소프트웨어 팩토리. Flue, tldraw 같은 주요 AI 오픈소스 프로젝트는 외부 PR을 거부하는 대신 에이전트 팀을 활용해 이슈를 분류·재현·수정·검토한다. Vercel의 AI SDK 프로젝트는 1,000개가 넘는 이슈와 800개가 넘는 PR 백로그를 줄이기 위해 다중 에이전트 '소프트웨어 팩토리'를 도입했다.
에이전트용 Terraform. HashiCorp는 HCP Terraform을 AI 주도 인프라를 위한 거버넌스 적용 컨트롤 플레인으로 내세우고 있다. 에이전트가 Terraform 변경을 작성·적용하게 하는 동시에 정책, 신원, 감사 통제를 강제한다.
datasette-mcp 업데이트. datasette-mcp 플러그인이 0.2 버전을 배포했다. SQL 쿼리 결과를 배열에서 객체로 바꿔 약한 모델이 컬럼을 올바르게 매핑하도록 돕는다.
연구 및 안전
BenchMIRT 벤치마크 감사. Hugging Face가 개별 프롬프트 수준에서 LLM 벤치마크를 감사하는 기법인 BenchMIRT를 발표했다. 이 기법은 벤치마크 내 프롬프트가 서로 다른 능력을 측정할 수 있고, 평균 점수가 그 차이를 가릴 수 있음을 보여준다.
Gemini 에이전트형 비디오. Google DeepMind가 Gemini 3.7/3.6/3.5 Flash-Lite에 에이전트형 비디오 이해 기능을 도입했다. 기본 제공 비디오 도구로 영상 구간을 동적으로 검색하고 검사해 정확도를 높이고 토큰 사용량을 줄인다.
Claude 텍스트 워터마킹. Anthropic이 워터마크 검증 API를 규제 기관, 언론, 팩트체커에 공개했다. 승인된 조직은 일부 편집에도 유지될 수 있는 통계적 패턴을 바탕으로 Claude 생성 텍스트를 판별할 수 있다. 이는 EU AI법이 요구하는 조치다.
선거 및 편향 문제. AlgorithmWatch는 Google의 선거 관련 AI Overview가 일관성이 없고, 의존하는 출처가 적으며, 후보를 당파적 표현으로 서술하기도 한다고 밝혔다. 별도로 Google의 AI 검색이 국적에 따라 응급 전화 조언을 제공한 사례가 있었고, 이로 인해 수정이 이뤄졌다.
산업 및 비즈니스
AfterQuery 급성장. AI 학습 데이터 스타트업 AfterQuery가 기업가치 32억 달러로 투자 유치에 성공한 것으로 알려졌다. 5개월 만에 10배 오른 가치로, Y Combinator 사상 최단기간 유니콘이 됐다. AfterQuery는 전문가처럼 작업을 끝내는 법을 모델이 학습하도록 실제 전문가를 고용한다.
AIR, 5천만 달러 유치. AI 보안 스타트업 AIR가 5천만 달러를 유치하며 스텔스 모드를 벗었다. 기업이 자사 에이전트를 파악하고 사용 중인 스킬, MCP 서버, 애드온을 지속적으로 검증하며 승인되지 않은 소프트웨어 상호작용을 차단하도록 돕는다.
Google, 할리우드 러브콜. Google이 AI 모델을 저작권 보호 콘텐츠로 훈련하기 위해 주요 영화 스튜디오와 라이선스 계약을 추진하며 큰 대가를 제안하는 것으로 알려졌다. 다만 분석가들은 이 계약이 스튜디오의 대외 이미지에 위험을 초래할 수 있다고 경고한다.
프런티어 AI 집중. Google DeepMind의 새 수장 Koray Kavukcuoglu는 프런티어 AI 리더십만이 중요하다고 말했다. 현재 모델이 프런티어 수준에 약간 못 미친다는 점을 인정하면서도 격차를 좁히겠다고 다짐했다. Gemini 4나 3.5 Pro에 대한 구체적인 소식은 없었다.
에이전트 실전 적용. OpenAI의 Enterprise Signals에 따르면 프런티어 기업은 활성 사용자당 출력 토큰을 8.3배 더 생성한다. 스타트업 Basis, Clay, Exa Labs는 에이전트를 온보딩, 계정 관리, 개발자 통합에 접목하고 있다.
Apple·OpenAI 법적 분쟁. Apple이 OpenAI를 상대로 신속한 증거개시(디스커버리)를 요청하고 나섰다. OpenAI가 전 Apple 직원의 MacBook을 조사하지 않았다는 주장이며, 이 MacBook에는 포렌식 데이터 파기에 관한 대화가 담겨 있었다.
Google Pics 디자인 툴. Google이 Workspace용 AI 이미지 생성·편집 도구인 Google Pics를 출시했다. Nano Banana 기반으로, 프롬프트 기반 디자인과 정밀한 객체 편집 기능을 앞세워 Canva·Adobe Express와 경쟁한다.
소비자용 AI 에이전트. Fambot은 가족 일정과 잡무를 관리하는 AI 수석 비서를 선보였다. John Deere는 농민이 자신의 데이터를 활용하게 해주는 JD AI 어시스턴트를, Amazon은 Alexa에 'Update Me When' 쇼핑 알림을 추가했다.
오늘은 여기까지입니다 - 약 5분 읽기 분량.