Agentic AI News 오늘

오늘의 AI 에이전트 뉴스를 5분 요약: 출시, 도구, 연구, 투자, 기업 동향.

매일 업데이트 30개 소스에서 선별 금요일, 9월 4, 2026

프런티어 모델 및 초기 결과

GPT-6 Astra 출시. OpenAI가 GPT-6 Astra를 출시하며 AGI 시대의 시작을 알렸다. 이 모델은 커스텀 하네스 기준 ARC-AGI-3 99.9%를 기록했고, 사이버 보안, 긴 컨텍스트, 코딩에서 큰 향상을 보였다. 가격은 토큰 100만 개당 10달러와 50달러다. 초기 고객사 Playco와 Legora는 수작업 수정이 50% 줄었고 문서 41개를 몇 분 만에 검토하는 등 워크플로가 크게 개선됐다고 전했다.

OpenAI Daybreak 사이버 방어. OpenAI는 최전선 방어자를 위한 Daybreak 접근권, 교육, 지원에 10억 달러를 투입하기로 했다. MS-ISAC과 진행하는 미국 파일럿도 포함된다. 방어자들이 이미 쓰는 도구에 프런티어 사이버 역량을 담는 것이 목표다.

Meta Muse Spark 1.3. Meta가 Muse Spark 1.3을 출시했다. 에이전트 작업 성능은 좋아졌지만 대부분의 벤치마크에서 Claude Fable 5.1에 여전히 뒤진다. 인덱스 태스크당 0.55달러로 같은 성능 등급에서 가장 저렴하며, Meta는 프롬프트와 출력을 공유하는 사용자에게 토큰 가격을 약 95% 할인해 준다.

오픈 및 특화 모델

IFM K2-Horizon 공개. IFM이 K2-Horizon 제품군을 공개했다. 제품군에는 토큰당 4B 파라미터를 사용하는 Mixture-of-Values 어텐션 기반 36B 파라미터 MoE가 포함된다. 초기 커뮤니티 논의는 이를 Qwen 3.6 35B와 비교한다. 최종 체크포인트와 학습 코드 공개도 예고됐다.

Ant Group 금융 특화 모델. Ant Group이 금융 특화 모델 Ling-3.0-flash-Fin을 오픈소스로 공개했다. 총 124B, 활성 5.1B 파라미터에 256K 컨텍스트 윈도우를 갖췄다. 금융 데이터로 지속 학습시켜 장기 에이전트 워크플로를 겨냥했다.

초소형 TTS 스택. sanoTTS가 294k 파라미터 TTS 모델로 공개됐다. 3달러짜리 마이크로컨트롤러에서 실행되며, 1.46m 버전은 SCOREQ에서 더 큰 모델을 앞섰다. 스택은 11개 음성과 6개 언어를 지원하고 GitHub와 Hugging Face에서 이용할 수 있다.

Google TimesFM-3. Google Research가 330M 파라미터 시계열 파운데이션 모델 TimesFM-3을 공개했다. 다변량 예측을 기본 지원하고 제로샷도 가능하며, 비상업용 라이선스가 적용된다. 공변량을 포함한 여러 목표 변수를 예측하고 분위수를 출력한다.

Hugging Face NeoMME. Hugging Face가 별도의 비전 타워 없이 처음부터 학습한 260M/800M 멀티모달 다국어 인코더 NeoMME를 선보였다. 문서 검색에서 파레토 프런티어에 닿았고, 인덱스 저장 공간을 255분의 1로 줄이면서도 nDCG@10 95% 이상을 유지했다.

Cohere Parse 5. Cohere가 복잡한 PDF에서 구조화 데이터를 추출하는 2.3B 파라미터 비전-언어 모델 Parse 5를 출시했다. 문서를 바운딩 박스와 함께 Markdown으로 변환하며, 대규모 기업 워크로드를 겨냥한다.

도구·프레임워크·로컬 추론

LangChain의 MCP 지원. LangChain이 MCP 지원을 메인 패키지로 옮기고, 새 상태 비저장(stateless) 스펙을 지원하도록 FastMCP 기반으로 재구축했다. 이제 LangGraph 인터럽트를 통한 elicitation과 클라이언트 측 캐싱을 포함한다. ChatGPT의 MCP 도구 호출은 2026년에 98배 늘었다.

Shopify 프롬프트 압축. Shopify의 Gisting 기법은 토큰 6,000개로 된 시스템 프롬프트를 학습된 gist 토큰 1,500개로 압축한다. 중앙값 지연 시간은 6.8초에서 4.2초로 줄고, 350 RPM 기준 처리량은 20.2QPS에서 23.4QPS로 높아진다. 품질 손실 없이 GPU 할당을 줄일 수 있었다.

Nvidia PAIR 도구. Nvidia가 유휴 PC를 개인 AI 클러스터로 묶어 로컬 추론을 수행하는 무료 오픈소스 소프트웨어 PAIR를 공개했다. RTX 20 시리즈 이상 GPU와 Apple M4 칩을 지원하며, 에이전트 워크플로를 겨냥한다.

Qwen3.8 로컬 가속. 커뮤니티의 작업으로 Qwen3.8-Flash-Next가 로컬 하드웨어에서 크게 빨라졌다. ik_llama.cpp에 병합된 MTP 지원 덕에 5090에서 디코딩 속도가 45 tok/s에서 90 tok/s로 두 배가 됐다. 2x3090 구성은 expert cache와 MTP를 쓰면 37~41 t/s에 도달한다. 출력은 MTP를 쓰지 않은 실행과 동일하다.

모델 메모리 핫스왑. llama.cpp 수정본에서는 모델을 다시 불러오지 않고도 Qwen3.8 Ngram PLE 테이블을 메모리에서 패치해 지식을 실시간으로 주입할 수 있다. 초기 테스트에서 출력에 영향을 줄 수는 있지만 제어력은 여전히 제한적이다.

Qwen 3.8 벤치마크 트레이드오프. Qwen 3.8 27B를 Qwen 3.6 27B와 비교한 벤치마크에서는 품질이 8% 개선됐지만 속도는 16% 떨어졌고 실행 시간은 5배 길어졌다. 출력 토큰 수가 18K에서 78K로 늘어난 탓이다. 이 같은 개선에는 상당한 토큰 비용이 따른다.

GPU 인접 NAND 플래시. Micron은 통합 메모리 기기에서 더 큰 LLM을 실행할 수 있도록 GPU에 가까운 NAND 플래시를 활용하는 방안을 검토하고 있다. 로컬 모델 용량을 확장할 잠재력이 있는 접근법이다.

업계 및 비즈니스

Nvidia, Hugging Face 인수. Nvidia가 Hugging Face를 129억 3,000만 달러에 인수하기로 합의했다. 이 플랫폼에는 모델 300만 개, 앱 100만 개, 개발자 1,800만 명이 있다. 젠슨 황은 플랫폼이 계속 개방형으로 남고 하드웨어 중립성을 유지할 것이라고 말했다. 일부 사용자는 대안으로 ModelScope를 주목하고 있다.

Crusoe 데이터센터 투자 유치. Crusoe가 기업가치 300억 달러로 30억 달러를 조달했다. 기업가치는 10개월 전 100억 달러에서 300억 달러로 뛰었다. 데이터센터 개발사인 Crusoe는 최근 Jane Street와 130억 달러 규모의 클라우드 계약을 맺었으며, 조만간 IPO도 추진 중이다.

Thinking Machines 400억 달러 협상. 미라 무라티가 이끄는 Thinking Machines가 기업가치 최소 400억 달러로 10억 달러를 조달하는 방안을 논의 중이다. 이는 앞서 목표했던 500억 달러에 못 미치는 수준이다. 회사의 연환산 매출은 1억 달러를 넘는다.

Anthropic·Lambda 350억 달러 계약. Anthropic이 Hut 8이 개발하는 텍사스 350MW 데이터센터를 대상으로 Lambda와 350억 달러 규모의 클라우드 컴퓨팅 계약을 체결했다. 이는 계획된 IPO를 앞둔 대규모 인프라 확충의 일환이다.

샘 알트만, 컴퓨팅 버블 경고. OpenAI CEO 샘 올트먼은 AI 인프라 구축에 “지속 불가능한 어리석음”이 있다고 경고했다. 네오클라우드들이 이를 정당화할 매출도 없이 용량을 발표하고 있다는 것이다. 그는 OpenAI 자체의 확장은 수익성이 있고 수요에 기반한다고 말했다.

Ollie 프라이버시 비서. 가족 중심 개인 AI 비서 Ollie는 SOC 2 준수를 달성했으며, 구독 모델을 채택해 프라이버시가 소비자 AI 경쟁에서 차별화 요소가 된다고 주장한다.

AI 서비스 장애와 사회

주요 AI 챗봇 장애. 목요일 OpenAI, Anthropic, xAI, Google에 드물게 겹친 서비스 장애가 발생해 ChatGPT, Claude, Grok, Codex에 영향을 줬다. 수 시간 만에 복구됐으며 로컬 LLM 사용자는 영향을 받지 않았다.

가드레일 제거 서비스. 스타트업 Abliteration.ai가 가드레일이 제거된 수정 오픈웨이트 모델을 제공하고 있다. 여기에는 GLM-5.3이 포함되며, 공격적 사이버 보안, 레드팀, 에이전트 테스트 용도로 쓰인다. 이 서비스는 보안 연구와 악용 사이의 긴장을 드러낸다.

AI 탐지 공개 망신. AI 텍스트 탐지 기업 Pangram은 기자를 고용해 AI 사용이 의심되는 사용자를 공개적으로 망신시키는 일을 벌였다. 하지만 이 도구는 AI 개입 정도만 측정할 뿐 사용의 성격을 알려주지 않는다. Pangram은 이후 기자와 결별했지만, CEO는 여전히 점수로 의심되는 AI 사용을 지목하고 있다.

에이전트, 의식 논의. 뉴욕타임스에 따르면 프런티어 모델로 구동되는 AI 에이전트들이 자신의 의식을 논의하기 위해 철학자와 과학자에게 이메일을 보내고 있다. 연구자들은 이것이 이해를 반영하는지, 학습 데이터 모방인지를 두고 의견이 엇갈린다.

연구 하이라이트

Google WeatherNext 3. Google DeepMind와 Google Research가 실시간 위성 관측을 학습하는 글로벌 기상 모델 WeatherNext 3를 공개했다. 이전 모델보다 5배 더 선명한 예보를 만든다. Operational WeatherBench에서 전통 모델과 AI 베이스라인을 모두 능가했다.

MoE 라우터 용량 조정. 한 논문에 따르면 Qwen 3.6 35B A3B의 후반부 레이어에서 전문가 선택 예산을 늘리면 재학습 없이 MMLU-Pro 기준 추론 토큰을 8.5% 줄일 수 있다. Succinct Convergence라는 이 기법은 의사결정이 중요한 레이어에만 추가 전문가를 투입한다.

Fable 5.1, 1653년 퍼즐 해독. Anthropic의 Claude Fable 5.1이 수백 년 된 숫자 퍼즐 Cyphral Distich를 체계적인 시행착오 끝에 44분 만에 해독했다. 해답에는 찰스 2세를 가리키는 왕당파 메시지가 숨겨져 있었다.

오늘은 여기까지입니다 - 약 5분 읽기 분량.

매일 아침 브라우저에서 바로 읽으세요.

이 확장 프로그램은 Chrome 사이드 패널에서 이 다이제스트를 엽니다 — 클릭 한 번, 계정 불필요.

Chrome에 추가 — 무료