Agentic AI News 오늘

오늘의 AI 에이전트 뉴스를 5분 요약: 출시, 도구, 연구, 투자, 기업 동향.

매일 업데이트 30개 소스에서 선별 일요일, 8월 30, 2026

에이전트 및 모델 릴리스

텐센트 Hy4 프리뷰. 텐센트가 Hy4 프리뷰를 공개했다. Hy3 대비 크기가 크게 늘었으며, 기본적으로 하이 리즈닝을 사용하고 no_think 모드를 지원한다. 커뮤니티에는 이미 약 2.38비트 공식 양자화 버전과 약 200GB GGUF가 나와 있으며, BF16 성능의 약 98%를 유지하는 것으로 알려졌다.

로컬 추론 및 하드웨어

FlashMLA sm_120 포트. 커뮤니티 빌드가 FlashMLA를 소비자용 Blackwell sm_120 GPU로 확장했다. 여러 스파스 MLA 워크로드에서 PyTorch SDPA 대비 2~3배 속도 향상을 보여줬고, FP8 KV 캐시 디코딩에서 지연 시간이 8% 낮아졌다.

Nemotron 16GB 수정. Nemotron-3.5-Lightning의 저비트 GGUF는 행 폭 양자화 때문에 실은 약 4.70bpw였다. 패치된 llama.cpp 빌드는 제대로 된 3.07bpw/11.77GiB 파일을 생성하며, 16GB에서 262K 컨텍스트를 구동한다.

맥에서 Qwen3.8-Flash-Next. llama.cpp 기반으로 128GB M5 Max에서 79GB 2비트 Qwen3.8-Flash-Next를 350K 컨텍스트 슬롯으로 구동한 사례다. 105K 프롬프트를 333초 만에 콜드 프리필했고, ngram-mod 추측 디코딩도 사용했다.

DeepSeek V4 Flash 듀얼 GPU. DGX Spark/GX10 2대 구성에서 DeepSeek V4 Flash 0731은 지속적으로 67~84 tok/s를 유지했다. 로컬 HumanEval Pass@1은 94.5%, GLM-5.3-Flash NVFP4는 97.0%였다. GLM은 벤치마크를 약 절반 시간에 마쳤다.

듀얼 5090에서 1M 컨텍스트. NInfer 포크는 텐서 병렬화와 YaRN ×4 스케일링을 추가해 5090 2대로 Qwen3.8-27B NVFP4를 1,048,576개 토큰 컨텍스트로 구동한다. 1M에서 48~100 tok/s 디코딩이 가능하며, MTP 수용률은 유지하는 반면 vLLM은 0으로 떨어진다.

16GB에서 27B. 하이브리드 양자화와 kvarn 캐시 설정 덕분에 Qwen3.8-27B를 16GB RTX 4070 Ti SUPER에서 100K 컨텍스트, 50 tok/s로 실행할 수 있었다. MTP 추측 디코딩과 테일 프리시전 KV 캐시를 사용한다.

FreeToken MoE 엔진. UC 버클리와 MIT 연구진이 오픈소스 엔진 FreeToken을 공개했다. MoE 전문가 전송을 동적으로 공동 스케줄링해 프런티어 스파스 모델이 PCIe/RAM 미스에 막히지 않고 소비자용 GPU에서 디코딩할 수 있게 한다.

벤치마크 및 평가

Terminal Bench 4.0. Terminal Bench 4.0이 새로워진 리더보드와 함께 공개됐다. 벤치마크 포화를 막기 위해 빠른 반복에 초점을 맞춘 업데이트다. GLM-5.3은 오차 범위 내에서 Fable 5 수준의 점수를 기록했다.

금융 벤치마크 공개. Ling-3.0-flash-Fin의 벤치마크 카드는 에이전트 스캐폴딩, 도구, 평가 파이프라인이 보고된 결과를 얼마나 크게 좌우하는지 보여준다. 많은 실행에서 웹 검색과 Python을 이용한 ReAct를 사용했으며, 일부 평가셋은 내부용이거나 아직 공개되지 않았다.

연구 및 에이전트 인프라

Google WikiSkill 메모리. 구글 리서치의 WikiSkill은 에이전트에게 과거 실패와 성공에 대한 지속적인 위키 형태의 지식 기반을 제공한다. 재사용 가능한 Agent Skills을 패키징해 모델 가중치를 바꾸지 않고도 행동을 안내한다.

Anthropic Model Hardware Standard. Anthropic은 에이전트가 현미경이나 로봇 팔 같은 물리적 장치를 제어할 수 있게 해주는 통합 인터페이스 MHS를 구축 중이다. 초기 테스트에서 다중 머신 통합 시간이 몇 주에서 몇 시간으로 줄었지만, 사람의 감독은 여전히 필요하다.

에이전트용 데이터 레이어. TOTVS 프레젠테이션은 트랜잭션 시스템과 데이터 레이크가 토큰을 많이 소비하고 지연 시간에 민감한 에이전트 추론에 최적화되어 있지 않다고 주장한다. 그리고 데이터 접근을 MCP와 시맨틱 모델 중심으로 진화시키는 방안을 설명한다.

LAION BVD. LAION이 연구 전용 데이터셋 BVD를 공개했다. 1,000만 시간 분량의 영상, 5,500만 개 클립, 3억 장의 정지 이미지로 구성되며 영상·오디오·텍스트를 연결한다. 이 데이터로 학습한 모델은 일부 벤치마크에서 InternVid 베이스라인보다 최대 2.1포인트 높은 성능을 기록했다.

산업 및 비즈니스

소니·워너, Anthropic 고소. 소니 뮤직 퍼블리싱, 워너 채펠 등 음악 출판사들이 Anthropic을 상대로 소송을 제기했다. Claude 학습을 위해 저작권 있는 작품을 토렌트로 다운로드하고 스크래핑했다고 주장하며, 작품당 최대 15만 달러의 손해배상을 요구하고 있다. Anthropic은 방어하겠다고 밝혔다.

OpenAI, Cursor 계약 종료. OpenAI는 SpaceX의 Cursor 인수 이후 Cursor와의 계약을 종료한다고 밝혔다. 일론 머스크 회사들이 계약을 자주 어겨 온 이력을 근거로 들었다. Anthropic은 이에 대응해 더 신뢰할 수 있는 파트너임을 내세우며, Cursor의 Claude 사용을 위한 컴퓨팅을 계속 지원하겠다고 약속했다.

GPU를 넘어선 Nvidia. Nvidia의 실적 서사는 GPU 점유율에서 데이터센터 오케스트레이션과 GPU 주변 시스템으로 옮겨가고 있다. AI 컴퓨팅이 기가와트 규모로 확장됨에 따라 Nvidia는 최첨단 네트워킹 및 오케스트레이션 하드웨어를 구축해 왔다.

오늘은 여기까지입니다 - 약 5분 읽기 분량.

매일 아침 브라우저에서 바로 읽으세요.

이 확장 프로그램은 Chrome 사이드 패널에서 이 다이제스트를 엽니다 — 클릭 한 번, 계정 불필요.

Chrome에 추가 — 무료