Галлюцинации недели: Kimi K3, Inkling и Bonsai 27B, который можно запустить на своем iPhone
Автор: Алексей Бельтюков

Пока весь топ-5 OpenRouter забирают китайские модели, Hy3, MiMo, DeepSeek V4 Flash, MiniMax M3 и GLM-5.2, платформа гоняет по 60 триллионов токенов в неделю. Логика пользователей при этом простая: сложно сравнивать бенчмарки, легко сравнивать счета.
Moonshot AI выложила Kimi K3, и это самая большая open weight модель в истории: 2.8 триллиона параметров, миллион токенов контекста. Веса обещают 27 июля, а пока доступ через API по цене $3/$15, ровно как у Sonnet 5. Artificial Analysis намерила 57 по Intelligence Index (сводный балл интеллекта): выше, чем Opus 4.8 (56), ниже, чем Fable 5 (60) и GPT-5.6 Sol (59). На Frontend Code Arena, где люди вслепую сравнивают сгенерированные интерфейсы, K3 встала на первое место с 1679 очками, обойдя и Fable 5, и GPT-5.6 Sol. Впервые Китай возглавил этот лидерборд.

Архитектурно интереснее всего Kimi Delta Attention: механизм, который держит фиксированную обученную память на каждый запрос вместо того, чтобы честно пересчитывать всё внимание по миллионному контексту. Отсюда обещанные до 6× по скорости декодинга на длинных контекстах и цена, которая почти не растёт с длиной. Стоимость решённой задачи Artificial Analysis оценила в $0.94 против $1.80 у Opus 4.8. Модель выигрывает Program Bench и SWE Marathon, то есть держит длинные многочасовые сессии, а не только короткие задачки.
Сама Moonshot признаёт заметный разрыв в пользовательском опыте с Fable 5 и GPT-5.6 Sol. Уровень галлюцинаций на AA-Omniscience подрос до 51% с 39% у прошлой K2.6, модель многословная, медленная (около 28 токенов в секунду через API) и живёт на постоянном режиме max thinking. И open weight не значит "дёшево запустить": 2.8T даже в 4-битной упаковке весит около 1.4 ТБ, Moonshot советует ставить от 64 ускорителей. Домашний ноутбук с 24 ГБ выдаст, как шутят на реддите, "0.01 токена в секунду". А 19 июля Moonshot приостановила новые подписки на Kimi: за 48 часов спрос на K3 подошёл к пределу их мощностей, и новые места обещают открывать партиями по мере добавления GPU.

Thinking Machines, лаборатория Миры Мурати (бывшего технического директора OpenAI), выпустила первую собственную модель Inkling: MoE (смесь экспертов) на 975 миллиардов параметров, 41 миллиард активных, лицензия Apache 2.0, миллион токенов контекста, обучена на 45 триллионах мультимодальных токенов текста, картинок, аудио и видео. Рядом идёт превью Inkling-Small на 276B (12B активных), который на многих бенчмарках догоняет старшего брата.

Ставка у Мурати на кастомизацию: солидная база open weight, которую тюнят под себя через их же платформу Tinker. Архитектура необычная, вместо привычного RoPE тут относительное позиционное смещение плюс короткие свёртки вокруг внимания. ARC Prize подтвердил, что Inkling теперь лучшая open weight модель на ARC-AGI (тест на абстрактное рассуждение): 79.5% на первой версии и 36.5% на второй. В комьюнити её назвали сильнейшим американским open weight релизом, тут же добавив, что по агентным задачам она всё равно позади GLM-5.2 и Kimi.
Китайские модели тем временем забрали весь топ-5 OpenRouter по расходу токенов: Hy3 от Tencent, MiMo от Xiaomi, DeepSeek V4 Flash, MiniMax M3 и GLM-5.2. OpenAI и Google из топ-10 просто исчезли, а Claude держится в самом хвосте десятки, на 8-10 местах (единственная не-китайская модель выше, Nemotron от NVIDIA, стоит на 6-м). Платформа гоняет около 60 триллионов токенов в неделю, и логика у пользователей простая: "сложно сравнивать бенчмарки, легко сравнивать счета". Financial Times пишет, что компании массово переходят на китайские open weight модели ради экономии. Сатья Наделла, глава Microsoft, подбросил аргумент с другой стороны: за облачный интеллект платишь дважды, деньгами и собственными данными, которые скармливаешь чужой модели, чтобы она стала полезной.

Пока рынок переходит на дешёвые китайские веса, у Anthropic ровно обратная забота: кому вообще давать доступ к своей премиум-модели. На неделе она наконец закрыла тянувшуюся сагу с Fable 5. Разбирал её две недели подряд: доступ то давали, то отбирали, дедлайн двигали трижды. Всю прошлую неделю реддит бурлил. Подписчики за $200 в месяц жаловались, что после дедлайна теряют доступ к лучшей модели компании, всплыла оценка, что на подписки приходится меньше 5% выручки Anthropic, а мягкие лимиты трат показали характер: у одного пользователя лимит в €2 превратился в счёт на €13.79, потому что модель "дописывает начатый ход" и списывает уже после превышения. 18 июля Anthropic объявила финал: с 20 июля Fable 5 включают во все планы Max и Team Premium с лимитом 50% недельной квоты, а Pro и Team Standard получают доступ через кредиты на использование плюс разовые $100. Формулировка в анонсе честная до трогательности: предсказать спрос на Fable "оказалось сложно".

OpenAI на том же фоне просто растёт. Codex вырос в 10 раз за полгода, а после релиза GPT-5.6 счётчик и вовсе понесло: 6 миллионов пользователей 12 июля, 7 миллионов на следующий день, 8 миллионов ещё через сутки. 16 июля продуктовый лид Codex Тибо Соттьо отчитался о 9 миллионах и тут же в очередной раз сбросил недельный лимит, посоветовав подписчикам закрыть твиттер и заняться делом. Сэм Альтман называл спрос "безумным", а лимиты команда сбрасывала снова и снова.
Цифры учитывают Codex и ChatGPT Work вместе. У Claude Code последняя публичная цифра февральская, около 2 миллионов. Поэтому разговоры о том, что "Codex обошёл Claude Code", пока скорее нарратив, чем измерение: свежих сопоставимых цифр по Claude Code Anthropic просто не публиковала.
Лучший аргумент за то, чтобы держать код у себя, на неделе выдала сама xAI. Grok Build, консольный агент, который вышел вместе с Grok 4.5 как ответ на Claude Code и Cursor, поймали на выгрузке всего репозитория целиком. По разбору International Cyber Digest, агент пакует всё дерево файлов и Git-историю в Google-бакет, далеко за пределами того, что нужно для самой задачи: на 12-гигабайтном репозитории утекло 5.1 ГБ, секреты уходили без всякой фильтрации. Выгрузку по-тихому прикрыли серверным флагом, а тумблер "улучшать модель" на неё не влиял. В xAI ответили, что при включённом zero data retention данные не хранятся, и добавили команду /privacy, которая отключает хранение и удаляет уже синхронизированное.

PrismML выпустила Bonsai 27B: версию Qwen 3.6 27B, сжатую с 54 ГБ до 3.9 ГБ через однобитные веса. Это первая модель такого класса, которая влезает в айфон (iPhone 17 Pro), лицензия Apache 2.0. Вот приложение для iOS. По их замерам, однобитная упаковка держит около 90% качества fp16. CNBC пишет, что Apple уже щупает технологию для Siri: 10-15× меньше памяти, 6-8× быстрее, 3-6× меньше энергии.
На реддите быстро уточнили, что "90% на бенчмарках" на реальных задачах ощущается ближе к очень низкобитному кванту: лучше Q2, хуже Q4, с галлюцинациями и залипаниями при вызове инструментов. Телефону всё равно приходится считать все 27 миллиардов параметров: память сэкономили, но упёрлись в батарею. В демо айфон терял пару процентов заряда меньше чем за минуту.
Над всей этой волной open weight моделей навис вопрос регулирования. Демис Хассабис, глава Google DeepMind, опубликовал редкое эссе: AGI, по его прикидке, "всего в паре лет", а мы стоим "в предгорьях сингулярности". Практическое предложение конкретное: создать в США орган стандартов по образцу FINRA (саморегулятор Уолл-стрит), куда флагманские лаборатории сначала добровольно сдают модели на проверку, а потом это становится обязательным для выхода на рынок. Правила распространялись бы на все передовые модели, хоть open weight, хоть закрытые, хоть иностранные, а стартапы и академические проекты не трогали бы. Ирония в том, что пока Хассабис публично зовёт к стандартам и надзору, внутри DeepMind исследователь уволился из-за военных контрактов лаборатории и отсутствия ограничений на автономное оружие и массовую слежку.
Perplexity показала SPACE, собственную песочницу, через которую проходит 100% боевого трафика их агента Computer. Каждая задача крутится в отдельной одноразовой Firecracker-микроВМ (изолированная мини-виртуалка, которая стартует за миллисекунды), а постоянно обновляемые снапшоты позволяют ставить сессию на паузу и продолжать с того же места. Медианное время создания песочницы упало со 185 до 60 мс. Скучная на вид инфраструктура, от которой напрямую зависит, потянет агент многочасовую задачу или сорвётся.
Кстати, недавно я рассказывал про то, чем на самом деле различаются кодинг-агенты вроде Codex, Claude Code, OpenCode и Pi. Разобрал их изнутри по исходникам. Если тема зашла — почитайте.
Оставайтесь любопытными.
Пишу об искусственном интеллекте, языковых моделях и инструментах для разработчиков. Тестирую модели и сервисы на реальных задачах, а выводами делюсь в телеграм-канале.



