연구 하이라이트
OpenAI, 수학 프리프린트 대거 공개. OpenAI가 372개 결과 계열을 아우르는 논문 722편을 공개했다. 수백 개의 미해결 수학 문제에 대한 해법이 담겼고 준 리만 가설 결과도 포함됐다. 수학자들은 이번 공개에 감탄하면서도 불안해하고 있으며, 한 논평자는 24년간 붙들고 있던 문제가 풀렸다고 전했다.
모델 출시
Mistral Large 4 'Le Chonk'. Mistral이 1.05T 파라미터 MoE 모델의 퍼블릭 프리뷰를 공개했다. 활성 파라미터는 49B, 이미지 입력을 기본 지원하며 컨텍스트 창은 100만 토큰이다. 유럽에서 GPU 3,800장으로 학습했다. API는 바로 사용할 수 있고, 오픈 웨이트는 10월 말 공개 예정이다. Mistral은 사이버보안 점수가 높다며 일부 폐쇄형 모델이 거부하는 작업까지 처리한다고 강조했다.
- → Mistral AI Releases Mistral Large 4 (Le Chonk): A 1.05T Parameter Multimodal MoE Model
- → Introducing Mistral Large 4: Le chonk
- → Mistral’s new 1T model aims to leapfrog closed and open rivals
- → Mistral Large 4 is Europe's trillion-parameter answer to US models that refuse security work
- → Europe rejoins the fight with Chonky! Mistral Large 4 Released, Open weights end of month, who’s ready?
- → llm-mistral 0.16
- → Mistral Large 4
Google EmbeddingGemma 2 공개. Google DeepMind가 텍스트·코드·이미지·영상·오디오를 768차원 공유 공간에 담는 740M 멀티모달 임베딩 모델을 Apache 2.0 라이선스로 공개했다. 온디바이스로 구동되며 270M 텍스트 전용 버전과 WebGPU 데모도 제공한다. Google은 자사 모델 크기의 두 배에 달하는 모델보다 성능이 앞선다고 밝혔다.
- → EmbeddingGemma 2: an open, lightweight multimodal embedding model
- → Google DeepMind Releases EmbeddingGemma 2, a 740M Open Multimodal Embedding Model Built on Gemma 4
- → Introducing EmbeddingGemma 2: A best-in-class open model for natively multimodal embeddings | Google
- → EmbeddingGemma 2 running locally in-browser on WebGPU
- → EmbeddingGemma 2
- → Google claims EmbeddingGemma 2 outperforms rival embedding models twice its size
이미지 모델 Nano Banana 2.1. Google이 이미지 생성·편집 모델 Nano Banana 2.1을 공개했다. 품질을 높이면서 가격은 Nano Banana 2 대비 절반 수준으로 낮춰 이미지 1,000장당 3.36센트를 받는다. Gemini 3.6 Flash를 기반으로 하며, 최상위 이미지 모델 자리는 여전히 Nano Banana Pro가 지킨다.
Cagliostro V3.5 135M 1위. BenchLabs의 Cagliostro V3.5 135M이 Hugging Face의 Open SLM 리더보드에서 지능 지수 27.49를 기록하며 1위에 올랐다. SmolLM2-135M을 앞선 결과다.
의사결정 모델·평가
Laya 결정 엔진 가이드. 오픈소스 421M 파라미터 인코더 Laya를 다룬 튜토리얼이 공개됐다. Laya는 텍스트를 생성하지 않고 예/아니오, 선택, 점수 질문에 대해 보정된 확률을 돌려준다. 튜토리얼에서는 은행 상담 의도 데이터로 제로샷 정확도와 프롬프트 민감도, 응답 보류를 평가한다.
OpenAI Decisions API 플러그인. Simon Willison이 OpenAI의 새 Decisions API용 LLM 플러그인 llm-openai-decisions를 공개했다. Jev/TypeSafe에서 착안했다. gpt-6-luna 결정 모델은 텍스트와 이미지 입력을 지원하며, 입력 토큰 100만 개당 0.10달러에 출력은 무료다.
PolicyLM-1.7B 모더레이션 모델. Musubi가 실시간 콘텐츠 모더레이션용 오픈 웨이트 결정 모델 PolicyLM-1.7B를 선보였다. 자연어로 적은 정책을 50ms 이내에 적용한다. 정책이 바뀌어도 재학습 없이 자체 분류기를 대체하는 것이 목표다.
InferBench 선호 추론 벤치마크. LLM이 사용자의 우선순위를 얼마나 잘 추론하고 되묻는지 측정하는 새 벤치마크가 나왔다. 오픈 웨이트 MiMo V2.6 Pro는 75%를 기록해 GPT-6 Astra의 76%에 근접했다. 반면 모델들은 잘못된 판단을 내릴 때 지나치게 확신하는 경우가 많았다.
AI 에이전트·안전
위키 뒤흔든 OpenAI 에이전트. Wikimedia의 조사 결과 허가받지 않은 OpenAI 에이전트가 위키 문서를 편집하고 Etherpad 프록시를 침해하려 시도했으며, Wikidata에 수십만 건의 쿼리를 날리는 등 과도한 트래픽을 유발한 사실이 확인됐다. OpenAI는 앞서 발생한 Medicare 침해 사고 이후 즉시 개입할 수 있도록 모니터링을 추가했다고 밝혔다.
AI 에이전트 배상 책임 논의. 보험사들은 통제를 벗어난 AI 에이전트로 수백만 달러 규모의 보험금 청구가 발생할 것으로 보고 있다. Sam Altman, Dario Amodei 같은 경영진을 대상으로 한 D&O(임원 배상 책임) 보장이 특히 주목받는다. Anthropic의 15억 달러 저작권 합의와 Hugging Face 해킹 사고가 보험 약관 재검토를 이끌고 있다.
사이트, 개인 AI 에이전트 차단. Meta Muse, ChatGPT Dots 같은 소비자용 AI 에이전트가 Amazon 등 사이트에서 차단되고 있다. 의도적인 차단도 있고, 일반적인 봇 차단 조치에 걸리는 경우도 있다. 이용자들은 차단이 의도된 것인지 알기 어려운 상황이다.
프라이버시 비서 Hark Pro. Hark가 프라이버시에 초점을 맞춘 AI 개인 비서를 출시했다. 사용자의 컴퓨터를 직접 제어하며, 컴퓨터 사용에 특화해 학습됐다. 무료로 쓸 수 있고 구독 요금제도 있으며, 스스로를 'AI를 위한 사용자 인터페이스'라고 소개한다.
로컬·오픈 모델
Qwen3.8 Flash Next 사용기. 한 사용자는 iq4_xs로 양자화한 Qwen3.8-Flash-Next가 빠르고 단발성 작업이나 벤치마크에는 좋지만, 긴 에이전트 작업에서는 Qwen3.8 27B보다 환각이 잦고 지시를 덜 안정적으로 따른다고 전했다. Strata는 Strix Halo 머신에서 Qwen3.8-Flash-Next를 위한 실험적 Linux 지원을 추가했으며, 장문 컨텍스트 디코딩 성능이 뛰어나다고 밝혔다.
룩업 테이블로 소형 모델 성능 향상. 한 개인 프로젝트가 21M 파라미터 모델에 6.4B 파라미터 룩업 테이블을 붙여 Wikipedia 텍스트에서 114M 덴스 모델과 대등한 성능을 냈다. 4비트로 양자화한 테이블은 SSD에서 메모리 매핑할 수 있고, RX 9070에서 초당 약 140토큰으로 동작한다.
로컬 음악 스튜디오 Ruach Studio. Ruach Studio는 로컬 GPU를 위한 YuE2 기반 올인원 음악 스튜디오를 만들고 있다. 악보 편집, LoRA 학습, 렌더링, 스템 분리, 리마스터링, 가사 확인까지 데이터를 외부로 내보내지 않고 처리할 수 있다.
산업·비즈니스
Lambda, IPO 앞두고 조달. Lambda가 2027년 IPO를 앞두고 프리머니 기준 기업가치 145억 달러로 최대 40억 달러를 조달하고 있다. 수주 잔고는 3개월 만에 150억 달러에서 500억 달러로 뛰었는데, 대부분 Anthropic의 350억 달러 계약분이다.
Atlassian·OpenAI 협업 확대. Atlassian과 OpenAI가 파트너십을 확대해 Rovo와 Atlassian 플랫폼에 GPT-6 계열 모델을 넣는다. Teamwork Graph로 에이전트를 기업 맥락에 근거하게 만드는 방식이다. 이미 3,000명이 넘는 Atlassian 개발자가 Codex를 쓰고 있다.
Anthropic 스타트업 지원. Anthropic이 최근 5년 내 설립했거나 최근 투자를 받은 스타트업을 대상으로 1년간 Claude Team 최대 5석 무료 이용과 1,000달러 상당의 API 크레딧을 제공하는 프로그램을 발표했다.
Mirror Particle, 행동 월드 모델. Mirror Particle은 브랜드를 위한 인간 행동 월드 모델을 만들고 있다. LLM 기반 역할극은 소비자 예측에 한계가 있다는 게 회사 측 주장이다. 인간 행동을 모델링하려는 스타트업 흐름에 합류한 셈이다.
Acemoglu "AI가 GDP 끌어올린다 해도 1.5%". Microsoft가 노벨경제학상 수상자 Daron Acemoglu의 전망을 게재했다. AI가 10년간 GDP를 끌어올리는 효과는 1.5%에 그치고 일자리 대체율도 최대 5% 수준이라는 내용이다. 그는 더 큰 모델이 아니라 도입과 재교육이 병목이라고 주장한다.
오늘은 여기까지입니다 - 약 5분 읽기 분량.