모델 출시
Qwen 3.8 27B. 알리바바의 Qwen 팀은 Apache 2.0 라이선스로 Qwen3.8-27B와 더 큰 Qwen3.8-2.4T-A95B를 출시했습니다. 27B 밀집 모델은 Qwen3.6-27B와 동일한 아키텍처를 공유하지만 학습 변경을 통해 코딩, 사무 작업, 에이전트 계획을 개선했습니다. 기본 컨텍스트 262k를 지원하며 1M 토큰까지 확장할 수 있습니다.
Zhipu의 GLM-5.3. Zhipu AI는 GLM-5.2와 동일한 기본 모델을 사용하지만 사후 학습을 확장한 GLM-5.3을 출시했습니다. 회사는 이를 가장 강력한 오픈 가중치 코딩 모델이라고 주장하며, 에이전트 코딩과 사이버 보안 취약점 발견에서 상당한 개선을 보였습니다. 가중치는 2주 내에 Hugging Face에 공개될 예정입니다.
메타의 Muse Glimmer. 메타는 Apache 2.0 라이선스로 소비자 GPU에서의 로컬 워크플로를 겨냥한 30B 에이전트 모델 Muse Glimmer를 오픈소스로 공개했습니다. 이는 더 큰 Muse Spark에서 추론 및 도구 호출 기술을 증류했으며, 30B 클래스에서 잠시 최전선에 있었습니다.
중국 오픈 모델 물결. 한 달도 안 되어 중국 연구소들은 Kimi K3, Qwen3.8, DeepSeek-V4-Pro-0813, GLM-5.3을 출시하며 오픈 가중치 최전선의 빠른 진전을 강조했습니다.
로컬 배포 및 커뮤니티
Apple Silicon 속도 향상. 새로운 mlx-dspark 릴리스는 Apple Silicon의 Qwen3.8-27B에 추측 디코딩을 도입하여 M4 Pro에서 동일한 출력 토큰을 생성하면서 생성 속도를 최대 약 3배 향상시킵니다.
양자화 및 가중치. Unsloth는 Qwen3.8-27B 양자화 가중치를 출시했고, Tim Dettmers는 단일 DGX Spark에서 GLM-5.3을 7 tokens/s로 실행할 수 있는 새로운 양자화 방법을 예고했습니다.
초기 Qwen 3.8 테스트. 커뮤니티 테스트에 따르면 Qwen3.8-27B는 강력한 원샷 코딩 데모와 에이전트 동작을 보여주지만, 일부 사용자는 xhigh 추론 노력에서 눈에 띄게 축소된 일반 지식과 매우 긴 사고 추적을 보고합니다. 권장 샘플링 매개변수는 모델 카드에서 확인할 수 있습니다.
- → Qwen 3.8 - 27B is a game changer
- → A hunch: Qwen3.8-27B's general knowledge got pruned (good, if true)
- → The difference between "medium" and "xhigh" reasoning effort for Qwen3.8-27B is actually insane.
- → Qwen 3.8 27B - Aquarium Burst Sample Test
- → RetroCraft - Qwen 3.8 27B Q8, one shot with exact performance data on dual 3090s.
검열되지 않은 로컬 변형. 커뮤니티 '이단자' 버전의 Qwen3.8-27B는 거부 및 안전장치를 제거하여 Opus 4.6과 같은 최전선 모델 수준의 로컬 무검열 대안을 제공하는 것을 목표로 합니다.
AI 투명성 및 안전
Anthropic 워터마크 감지. Anthropic은 제3자 개발자가 Claude가 생성한 것으로 보이는 텍스트를 감지할 수 있도록 워터마크 감지 API를 제공할 예정입니다. 이 방법은 SynthID Text를 사용하며 짧거나 사실이 많거나 대대적으로 재작성된 텍스트에서는 신뢰도가 낮습니다.
Google, 워터마크 선택 사항으로. Google은 사용자가 Nano Banana, Omni, Lyria에서 생성된 AI 이미지, 비디오, 음악의 가시적 워터마크를 끌 수 있도록 허용합니다. 보이지 않는 SynthID 및 C2PA 메타데이터는 검증을 위해 계속 포함됩니다.
법정에서의 프롬프트 인젝션. 코네티컷 판사는 사건을 검토하는 AI 시스템을 조작하려는 숨겨진 텍스트가 포함된 최초의 미국 법원 문서로 보이는 것을 기록했습니다. 숨겨진 지침은 효과가 없었지만 판사는 그 전술을 위험하다고 말했습니다.
프로덕션 에이전트
Claude Code 유지보수 업무. Anthropic에 따르면 Claude Code는 자체 앱에서 일일 유지보수를 실행하여 인간 검토 후 46% 병합률로 388개의 풀 리퀘스트를 생성했습니다. 루틴에는 크래시 퍼징, 중복 추상화 정리, 종속성 검사가 포함됩니다.
OpenAI Computer History. OpenAI의 Computer History는 Chronicle 스크린샷 프로토타입을 대체하여 macOS에서 클릭, 키 입력, 앱 전환을 기록해 검색 가능한 타임라인을 구축합니다. 반복되는 워크플로를 감지하고 ChatGPT 및 Codex에 재사용 가능한 스킬을 제안할 수 있습니다.
산업 및 비즈니스
미중 가격 전쟁. OpenAI와 Anthropic은 중국 오픈 모델이 영향력을 얻으면서 가격을 인하하고 있습니다. Google의 Gemini 3.7 Flash는 코딩과 에이전트를 겨냥한 50% 할인된 출시 가격으로 데뷔했습니다. 주요 미국 연구소의 토큰 가격은 7월 중순 이후 거의 4분의 1 하락했습니다.
GPT-5.6 Sol Ultrafast. OpenAI는 Cerebras로 구동되는 GPT-5.6 Sol의 Ultrafast 모드 미리보기를 출시하여 초당 최대 750개의 출력 토큰을 제공합니다. API 서비스는 초기에 선별된 고객에게만 제공되며 사고나 시장 이벤트 중 실시간 분석을 목표로 합니다.
메타의 모두를 위한 AI. 메타는 Glimmer 출시와 함께 AI가 모든 사람에게 공개되어야 한다는 주장하는 긴 저커버그 서한을 함께 발표했지만, 팟캐스트 보도에 따르면 회사는 가장 강력한 Muse Spark를 API 뒤에 유지하고 있습니다. 같은 논의에서 2억 5천만 달러 규모의 실패한 인수도 언급됩니다.
Apple-Alibaba 중국 모델. Apple은 중국 기기에 Apple Intelligence를 도입하기 앞서 알리바바의 도움으로 중국 시장용 맞춤형 AI 모델을 학습시킨 것으로 알려졌습니다. 이 파트너십은 드문 미중 AI 협력 사례입니다.
Kog 추론 추진. 프랑스 스타트업 Kog는 소프트웨어 최적화를 통해 AMD MI300X 및 Nvidia H200과 같은 기존 GPU에서 더 많은 속도를 끌어내어 소프트웨어 엔지니어링 워크로드의 단일 요청 디코딩 속도를 높이는 것을 목표로 합니다.
천연가스 가격 리스크. 새로운 Noreva 예측은 Amazon, Google, Meta, Microsoft 같은 하이퍼스케일러가 AI 데이터 센터용 가스 전력을 확보함에 따라 미국 일부 지역에서 천연가스 가격이 3배가 될 수 있다고 경고합니다.
연구 하이라이트
150M ARC 모델. 1억 5천만 파라미터의 순환 잠재 추론 모델이 작업당 0.0007달러의 비용으로 ARC-AGI-1에서 29.5%를 기록하며, 발표된 비용-정확도 최전선 밖에 있습니다. 최소한의 하드웨어에서 실행되지만 수십억 파라미터로의 확장은 여전히 필요합니다.
자율 연구에 대한 의문. Princeton과 영국 AISI의 연구는 미공개 NeurIPS 논문을 사용하여 현재 최전선 모델이 연구 엔지니어링을 처리하지만 중요한 연구 부분에서는 실패한다는 것을 발견하여 자율 AI 연구에 대한 연구소의 주장과 모순됩니다.
DarwinX 하네스 진화. DarwinX는 모델 가중치를 고정한 채 프롬프트, 도구, 스킬, 제어 흐름에 대한 자연 선택을 통해 에이전트 하네스를 진화시킵니다. 네 가지 벤치마크에서 평균 약 17포인트를 추가하며 SWE-bench Verified에 변경 없이 전이됩니다.
PlayWorld 벤치마크. PlayWorld는 171개의 장기 목표를 추구하는 멀티모달 에이전트 플레이어를 사용하여 비디오 월드 모델을 벤치마킹하며, 기하학적 일관성, 상호작용 충실도, 시야 밖 진화, 통찰력 진화를 측정합니다.
오늘은 여기까지입니다 - 약 5분 읽기 분량.