Передові моделі та ранні результати
Запуск GPT-6 Astra. OpenAI випустила GPT-6 Astra і назвала це початком епохи AGI. Модель набирає 99,9% на ARC-AGI-3 із кастомним харнесом, показує помітний прогрес у кібербезпеці, довгому контексті та написанні коду, а її ціна становить $10/$50 за мільйон токенів. Перші клієнти Playco і Legora повідомляють про суттєве покращення процесів: ручних виправлень на 50% менше, а 41 документ можна переглянути за лічені хвилини.
- → GPT-6 Astra: an automated AI Engineer you can hire for <$6 an hour
- → GPT‑6 Astra
- → GPT-6 Astra is the first model making OpenAI willing to declare the "AGI era"
- → OpenAI launches Astra, its powerful (and controversial) new model
- → OpenAI’s next big AI model has ‘entered the AGI era’
- → Playco cut manual fixes 50% prototyping games with GPT-6 Astra
- → Legora reviewed 41 documents in minutes with GPT-6 Astra
OpenAI Daybreak для кіберзахисту. OpenAI зобов’язалася виділити $1 млрд на субсидування доступу до Daybreak, навчання та підтримки захисників на передовій, зокрема через пілотний проєкт у США з MS-ISAC. Ініціатива має перенести передові кіберможливості в інструменти, якими захисники вже користуються.
Meta Muse Spark 1.3. Meta випустила Muse Spark 1.3. Він краще справляється з агентними задачами, але на більшості бенчмарків досі поступається Claude Fable 5.1. За $0,55 за індекс-завдання це найдешевша модель у своєму класі продуктивності, а Meta пропонує користувачам, які діляться промптами і результатами, приблизно на 95% нижчі ціни за токени.
Відкриті та спеціалізовані моделі
IFM K2 Horizon. IFM представила родину K2-Horizon, зокрема MoE-модель на 36B параметрів із механізмом уваги Mixture-of-Values, яка на кожен токен задіює 4B параметрів. У ранніх обговореннях спільнота порівнює її з Qwen 3.6 35B. Розробники обіцяють фінальні чекпоїнти та код навчання.
Фінансова модель Ant Group. Ant Group відкрила вихідний код Ling-3.0-flash-Fin — фінансово вдосконаленої моделі зі 124B загальних та 5,1B активних параметрів і контекстним вікном 256K. Модель отримана продовженим навчанням на фінансових даних і призначена для тривалих агентних робочих процесів.
Найменший TTS-стек. Випущено sanoTTS — TTS-модель на 294k параметрів, яка працює на мікроконтролері за $3. Версія з 1,46 млн параметрів перевершує більші моделі в тесті SCOREQ. Стек підтримує 11 голосів і 6 мов, а його код доступний на GitHub і Hugging Face.
Google TimesFM-3. Google Research випустила TimesFM-3 — фундаментальну модель для часових рядів із 330M параметрів. Вона нативно підтримує багатовимірне прогнозування і zero-shot; ліцензія некомерційна. Модель прогнозує кілька цільових показників із коваріатами та повертає квантилі.
Hugging Face NeoMME. Hugging Face представила NeoMME — мультимодальний багатомовний енкодер на 260M/800M параметрів, натренований з нуля без окремого vision-енкодера. Він виходить на межу Парето у пошуку документів і скорочує обсяг сховища індексів у 255 разів, зберігаючи понад 95% nDCG@10.
Cohere Parse 5. Cohere випустила Parse 5 — vision-language модель на 2,3B параметрів, яка витягує структуровані дані зі складних PDF. Документи конвертуються в Markdown із bounding boxes. Модель розрахована на великі корпоративні навантаження.
Інструменти, фреймворки та локальний інференс
MCP у LangChain. LangChain перенесла підтримку MCP в основний пакет і переписала її на FastMCP для роботи з новою stateless-специфікацією. Тепер у пакеті є запити на уточнення через переривання LangGraph і кешування на клієнтському боці. За 2026 рік кількість викликів MCP-інструментів із ChatGPT зросла в 98 разів.
Стиснення промптів у Shopify. Техніка Shopify під назвою Gisting стискає системний промпт із 6000 токенів до 1500 вивчених gist-токенів. Це скорочує медіанну затримку з 6,8 до 4,2 секунди та підвищує пропускну здатність з 20,2 до 23,4 QPS при 350 RPM. Завдяки такому підходу вдалося зменшити кількість виділених GPU без втрати якості.
Інструмент Nvidia PAIR. Nvidia випустила PAIR — безкоштовне програмне забезпечення з відкритим кодом, яке об’єднує незадіяні ПК у персональний ШІ-кластер для локального інференсу. Воно працює з графічними процесорами серії RTX 20 і новішими, а також із чипами Apple M4, і орієнтоване на агентні робочі процеси.
Qwen3.8: локальне прискорення. Спільнота помітно пришвидшила Qwen3.8-Flash-Next на локальному залізі. Підтримка MTP, додана в ik_llama.cpp, подвоює декодування на 5090 — з 45 до 90 ток/с, а зв’язка 2x3090 із expert cache і MTP досягає 37–41 ток/с. Результат ідентичний запускам без MTP.
Заміна пам’яті моделі на льоту. Модифікація llama.cpp дає змогу змінювати Ngram PLE-таблицю Qwen3.8 просто в пам’яті та додавати знання в реальному часі, без перезавантаження моделі. Ранні тести показують, що так можна впливати на вивід, але ступінь контролю поки що обмежений.
Компроміс Qwen 3.8 у бенчмарках. Порівняння Qwen 3.8 27B з Qwen 3.6 27B показує покращення якості на 8%, але швидкість падає на 16%, а час виконання зростає вп’ятеро — через 78K вихідних токенів проти 18K. Такий приріст коштує значно більше токенів.
NAND-флеш поруч із GPU. Micron вивчає можливість розміщення NAND-флеш-пам’яті поруч із GPU, що дасть змогу запускати більші LLM на пристроях з уніфікованою пам’яттю та, ймовірно, збільшить граничний розмір локальних моделей.
Індустрія та бізнес
Nvidia купує Hugging Face. Nvidia домовилася придбати Hugging Face за $12,93 млрд. Платформа налічує 3 млн моделей, 1 млн застосунків і 18 млн розробників. Дженсен Хуан каже, що сервіс залишиться відкритим і незалежним від апаратного забезпечення, але частина користувачів уже придивляється до ModelScope як альтернативи.
- → Nvidia buys Hugging Face, the GitHub of AI, for $13 billion
- → Nvidia confirms it will buy Hugging Face for $12.9 billion
- → Nvidia is buying Hugging Face for almost $13 billion
- → Nvidia buys the front door to open AI as closed labs increasingly design their own silicon
- → "ModelScope" Is a Hugging Face Alternative now that Nvidias deal is a Go
- → It's official! Nvidia to acquire Hugging Face for 12.9 billion dollars.
Раунд Crusoe на $3 млрд. Crusoe залучила $3 млрд за оцінки $30 млрд — проти $10 млрд 10 місяців тому. Компанія, яка будує дата-центри, нещодавно уклала з Jane Street контракт на хмарні обчислення обсягом $13 млрд і розглядає IPO найближчим часом.
Оцінка Thinking Machines сягає $40B. Компанія Міри Мураті Thinking Machines веде переговори про залучення $1 млрд за оцінки щонайменше $40 млрд — нижче від раніше озвученої мети у $50 млрд. Виторг компанії в річному вимірі перевищує $100 млн.
Контракт Anthropic–Lambda на $35B. Anthropic підписала з Lambda угоду про хмарні обчислення на $35 млрд для техаського дата-центру потужністю 350 МВт, який розвиває Hut 8. Це частина масштабного розширення інфраструктури напередодні запланованого IPO Anthropic.
Альтман про бульбашку в обчисленнях. Генеральний директор OpenAI Сем Альтман попередив, що в нарощуванні ШІ-інфраструктури є «нежиттєздатне безглуздя»: neocloud-компанії анонсують нові потужності без відповідних доходів. За його словами, власна експансія OpenAI прибуткова та підкріплена попитом.
Приватний асистент Ollie. Ollie — сімейний персональний ШІ-асистент. Він пройшов сертифікацію SOC 2 і працює за підпискою; у компанії кажуть, що приватність вирізняє його серед споживчих ШІ.
Збої ШІ та суспільство
Масштабний збій ШІ-чатботів. OpenAI, Anthropic, xAI і Google у четвер мали рідкісні збої, що частково збіглися в часі та зачепили ChatGPT, Claude, Grok і Codex. Роботу сервісів відновили через кілька годин; на користувачів локальних LLM це не вплинуло.
Зняття ґардрейлів у моделях. Стартап Abliteration.ai пропонує модифіковані моделі з відкритими вагами без ґардрейлів, зокрема GLM-5.3, — для наступальних кібероперацій, red-teaming і тестування агентів. Така послуга показує напругу між дослідженнями у сфері безпеки та зловживаннями.
Публічне осоромлення через ШІ-детекцію. Компанія Pangram, що займається виявленням ШІ-текстів, найняла журналіста, аби публічно осоромлювати користувачів, запідозрених у використанні ШІ. Проте інструмент вимірює лише міру участі ШІ, а не характер використання. Згодом компанія припинила співпрацю, хоча її генеральний директор досі використовує бали, щоб викривати ймовірне застосування ШІ.
ШІ-агенти питають про свідомість. За даними The New York Times, ШІ-агенти на передових моделях пишуть філософам і науковцям, щоб обговорити власну свідомість. Дослідники розходяться в думках, чи це прояв розуміння, чи лише імітація навчальних даних.
Головне з досліджень
Google WeatherNext 3. Google DeepMind і Google Research представили WeatherNext 3 — глобальну модель погоди, яка навчається на супутникових спостереженнях у реальному часі та дає прогнози в 5 разів чіткіші за попередні моделі. Вона перевершує традиційні та ШІ-базлайни в тесті Operational WeatherBench.
Ліміт експертів у MoE. У статті показано, що розширення ліміту вибору експертів у пізніх шарах Qwen 3.6 35B A3B зменшує кількість токенів міркування на 8,5% у MMLU-Pro без додаткового навчання. Метод під назвою Succinct Convergence додає додаткових експертів лише в шарах, критичних для ухвалення рішення.
Fable 5.1 розв’язала головоломку. Модель Anthropic Claude Fable 5.1 розшифрувала багатовікову числову головоломку Cyphral Distich за 44 хвилини, застосувавши систематичний перебір. У розв’язку було приховано послання роялістів, що вказувало на короля Карла II.
Це все на сьогодні - приблизно 5 хвилин читання.