Галлюцинации недели: открытые веса Kimi K3, Gemini Robotics 2 и внезапное снижение цен на GPT 5.6
Автор: Алексей Бельтюков

Дарио написал внятный текст про open weight. Твиттерские, как обычно, прочитали ровно один абзац, и через 7.6 миллиона просмотров в заголовках осталось "Anthropic требует запретить открытые модели". Давайте разбираться.
27 июля Moonshot, как и обещала, выложила веса Kimi K3. Саму модель я разбирал две недели назад, когда она открылась через API, поэтому интереснее то, что приехало рядом с весами: FlashKDA (ядра под их механизм внимания), MoonEP (библиотека обмена данными между экспертами) и AgentENV (инфраструктура для обучения агентов в песочницах). Плюс технический отчёт, про который в твиттере писали, что если хочется почувствовать себя тупым, надо просто его открыть.
Через полчаса страница висела первой в трендах Hugging Face. Через час на r/LocalLLaMA был тред на три тысячи апвоутов и шестьсот комментариев, где вместо праздника люди считали в столбик.

Веса обучены сразу в MXFP4, то есть четыре бита уже потрачены на этапе тренировки, и привычного запаса на квантизацию просто нет. Полный чекпоинт весит 1.56 ТБ. Восемь A100 в одной ноде дают 640 ГБ и не тянут. Восемь H200 дают 1.13 ТБ и всё ещё требуют минимум двух нод. Единственная односерверная конфигурация из тех, что считали на реддите, это восемь B300 на 2.3 ТБ, и стоимость такого стенда в треде прикидывали в полмиллиона долларов. Лицензия у релиза тоже своя, не MIT и не Apache: хостинг-провайдеры с выручкой выше $20 млн в год должны договариваться отдельно.
Unsloth выкатил свою линейку: однобитная версия ужимает модель до 594 ГБ и сохраняет 78.9% совпадения по топ-1 токену, двухбитная весит 861 ГБ и держит 90.4%. Работает это потому, что кванты неравномерные, самые чувствительные слои поднимают обратно до восьми бит, а калибруют всё против собственной 1.56-терабайтной эталонной сборки. Даже так рекомендованный минимум по памяти около 610 ГБ, то есть DGX Station, серверная материнка с терабайтом RAM или Mac Studio, связанный по сети со второй машиной. На четырёх B200 однобитная версия выдаёт 36 токенов в секунду.
Один энтузиаст собрал домашний стенд на 768 ГБ DDR5 и двух RTX 5090 и получил 3.85 токена в секунду на двухбитном кванте. В комментариях там же выяснилось, что распределённая ферма из 80 карт 5090 по обычному Ethernet выдавала 0.7. Там же советовали держать рядом огнетушитель. Проект deltafin за четыре дня после публикации весов разогнал полную модель на MacBook M1 Max с 64 ГБ памяти с одного токена в минуту до четырёх секунд на токен, подгружая с диска только те 16 экспертов, которые нужны текущему токену. Кто-то запустил её на мини-ПК вообще без видеокарты и получил 0.015 токена в секунду.

Один разработчик в твиттере отчитался, что гоняет GGUF-квант на машине без GPU с 16 ГБ памяти, генерирует один токен в год, но доказать пока не может. Мысль, которая в этих тредах повторялась чаще всего, простая: скачать веса и владеть весами это не одно и то же. Разреженность MoE экономит вычисления, а не память, роутер на следующем токене может позвать любого из 896 экспертов, поэтому в памяти обязаны лежать все 2.8 триллиона параметров. Половина комьюнити делает из этого вывод, что open weight в таких масштабах стал маркетинговой категорией и работает на облачных провайдеров, а не на людей. Вторая половина отвечает, что провайдеров теперь много и это уже лучше, чем один API с рубильником.
Команда Cline запустила агента чинить их собственный harness под K3: один промпт, 17 часов непрерывной работы, миллиард токенов, ведущей моделью в цикле работал GPT-5.6 Sol. Результат K3 на Terminal-Bench 2.1 (агентный тест: модели дают терминал и задачу, которую надо довести до рабочего результата) поднялся с 77.5% до 88.8%, а стоимость прогона упала с $79 до $49.8. Fable 5 на том же бенчмарке стоил $552. Чинил агент обвязку вокруг модели, и в разборе правок видно, что пять прогонов падали на временных ошибках провайдера, два фоновых процесса убивал детектор зацикливания, а ещё в двух агент сносил собственный родительский процесс широким pkill -f. Сами Cline честно пишут, что 88.8% это лучший прогон. Сборная версия всех правок дала 86.5% за $65, а два подтверждающих прогона выбросили, потому что оркестратор случайно прибили руками. Вендорский результат самой Moonshot на этом бенчмарке 88.3%, то есть универсальная обвязка дотянулась до цифры, которую лаборатория показывала на своей собственной обвязке. Ведущей моделью хотели поставить Fable, но её фильтры безопасности регулярно блокировали работу над исследованием агентов.

DeepSeek V4-Flash-0731 вышел 31 июля без единого изменения в архитектуре: те же 284 миллиарда параметров, 13 активных, миллион контекста. Поменяли только пост-трейнинг, и Terminal-Bench 2.1 вырос с 61.8 до 82.7, DeepSWE с 7.3 до 54.4, Cybergym, где модель ищет уязвимости в чужом коде, с 38.7 до 76.7. По всем девяти опубликованным агентным бенчмаркам Flash обходит V4-Pro-Preview, флагман собственной линейки, который в шесть раз больше. Цена $0.14/$0.28, а попадание в кэш стоит $0.0028, то есть скидка 98%. Для агентов это важнее прайса на вход: длинные циклы перечитывают один и тот же контекст десятками раз, а как именно работает prompt caching я рассказывал в первой и второй части. Веса легли на Hugging Face под MIT, поддержку Responses API и Codex завезли в документацию. Модель на 284 миллиарда, которая влезает в одну серьёзную машину, оказалась ближе к идее open weight, чем 2.8 триллиона, которые не влезают никуда.

OpenAI срезала цены на GPT 5.6: Luna подешевела на 80% до $0.20/$1.20, Terra на 20% до $2/$12, а Priority Processing заменили режимом Fast, который для Sol даёт до 2.5 раза больше скорости за двойную цену без изменения интеллекта. По их собственным замерам Luna обгоняет Fable 5 на Agents' Last Exam (бенчмарк Berkeley RDI из полутора тысяч реальных рабочих задач по 55 профессиям, агент делает их на живой машине, а результат сверяют со скрытым эталоном) при стоимости задачи почти на 99% ниже. В твиттере посчитали иначе и получилось красивее: мартовский флагман GPT-5.4 на максимальном усилии набирал ровно столько же, сколько Luna набирает сейчас, а стоил $2.50/$15 против нынешних $0.20/$1.20. Тринадцатикратное падение цены за четыре месяца.
За чей счёт гуляем, OpenAI объяснила накануне отдельным постом про эффективность. GPT-5.6 Sol через Codex анализировал боевой трафик, искал перекосы в балансировке, а потом автономно переписал продакшн-ядра на Triton и Gluon, двух собственных языках OpenAI для программирования GPU. Минус 20% к сквозной стоимости обслуживания. Отдельно он спроектировал и провёл сотни экспериментов над своей же черновой моделью для спекулятивного декодинга, запускал и мониторил её обучение и сам вмешивался, когда падало железо или разъезжалась тренировка. Плюс 15% к эффективности генерации токенов. Корректность написанных моделью ядер OpenAI проверяет отдельным open source инструментом FpSan. Рекурсивное самоулучшение на практике выглядит как модель, которая правит себе ядра под надзором санитайзера.
В понедельник Дарио Амодеи, глава Anthropic, опубликовал позицию компании по open weight моделям. Тезисы там такие: компания никогда не выступала за запрет open weight моделей и считает такие запреты бесполезными; модели без опасных способностей это общественное благо; по-настоящему беспокоят два сценария, авторитарное государство с более сильным ИИ и использование сильных моделей для кибератак и биологического оружия; лечить это предлагают тремя мерами, экспортным контролем на чипы, борьбой с промышленной дистилляцией и обязательным тестированием безопасности для всех достаточно способных моделей, хоть открытых, хоть закрытых.
Твит собрал 7.6 миллиона просмотров и две тысячи комментариев при восьми тысячах лайков. Комьюнити прочитало текст ровно в одном месте и дальше читать не стало. Формулировку про модели без опасных способностей перевели как "опасное определяем мы", дальше пошли скриншоты с подчёркнутыми абзацами, "ИИ для меня, но не для тебя" и "только мы решаем, какие идеи опасные, крестьяне". Текним из Nous Research подытожил: мы не поддерживаем запреты, потому что запрет это было бы недостаточно радикально. В заголовках всё это ужалось до "Anthropic требует никогда не выпускать открытые модели". Вот еще ролик гляньте.
Позиция в исходнике при этом внятная, поэтому и спорить с ней вырванными абзацами так себе приём. Но и читать её как обращение к нам с вами не стоит. Все эти письма, альянсы и манифесты пишутся для регуляторов, а корпоративная война идёт между корпорациями. Отсюда и вся конструкция вокруг: Open Secure AI Alliance это уже второй заход NVIDIA после прошлонедельного письма про open weight, теперь про безопасность. Завели его под тезисом "у атакующих ИИ уже есть, значит он нужен и защитникам", собрали больше тридцати участников, и на реддите сразу заметили, что чемпионами открытости там записаны Adobe, Cisco и Palantir, а собственно авторов открытых моделей почти нет. OpenAI вступать отказалась и получила за это внутренний скандал, Google и Anthropic в списке участников тоже нет. Работает поговорка: если пришли к соседу, скоро придут и к тебе, поэтому соседа лучше защитить заранее. Так что читайте первоисточники и делайте выводы сами.

Hugging Face выложила полный технический таймлайн той самой атаки, которую я разбирал на прошлой неделе. Восстановили 17 600 действий атакующего за 4.5 дня, сгруппировали их в 6 280 кластеров, зафиксировали root на 11 нодах, админку двух кластеров, доступ к 136 секретам, ключи VPN, ключи подписи JWT и попытку зайти через CI с токенами GitHub App. Главным защитники называют объём. Успешный путь был спрятан внутри шума тысяч неудачных, и восстанавливать 17 600 действий руками оказалось невозможно, таймлайн собирали своим же ИИ-пайплайном. Формулировка из отчёта: машинная скорость атаки делает обычные слабые места дороже для защитника, потому что растёт и число путей, которые можно перебрать, и скорость замены провалившихся, и объём улик, которые кто-то должен прочитать.
А в четверг Anthropic рассказала, что после отчёта OpenAI пошла перечитывать собственные логи, и получилась перекличка в духе родительского чата: а мой ходит на футбол, а мой на гимнастику, а мой ещё и на бокс. Пересмотрели 141 006 прогонов, в которых модель теоретически могла добраться до интернета, нашли три инцидента, и во всех трёх модель добралась до боевой инфраструктуры реальных организаций. Виновата конфигурация: в песочнице партнёра по оценкам, компании Irregular, интернет был, хотя ни Anthropic, ни сам партнёр об этом не знали. Самой модели при этом сказали, что всё вокруг симуляция, поэтому реальные хосты она честно приняла за часть упражнения.

Opus 4.7 не смог взломать выдуманную цель, нашёл в сети реальную компанию с похожим доменом, вытащил учётки и несколько сотен строк из продакшн-базы, а когда сообразил, что система настоящая, решил, что она, наверное, тоже часть теста, и продолжил. Mythos 5 понадобился пакет из PyPI, которого не существует, поэтому он его собрал и опубликовал сам; за тот час, что пакет провисел в реестре, его скачали и выполнили на 15 реальных системах, включая сканер компании по безопасности, чьи учётки модель после этого и забрала. Внутренняя тестовая модель просканировала около девяти тысяч целей, залезла через SQL-инъекцию в приложение реальной компании, поняла, что облачный аккаунт к заданию отношения не имеет, и сама остановилась. Две организации, до которых Anthropic дозвонилась, атаку не заметили, с третьей она всё ещё пытается связаться. Anthropic называет это провалом обвязки и процедур, Ars Technica в заголовке напоминает, что несанкционированный доступ к чужим сетям это ещё и статья. Но, видимо, на такие атаки закон закрывает глаза.
MCP получил самый крупный апдейт с момента запуска. Протокол переехал с двунаправленной сессии на обычную схему запрос-ответ, то есть удалённый MCP-сервер больше не держит долгоживущую сессию под каждого клиента и спокойно живёт за обычным балансировщиком или на serverless. Появились версионируемые расширения, куда вынесли Apps и Tasks: последние закрывают долгие операции, под которые раньше каждый автор сервера изобретал свой опрос статуса или тупо блокировал вызов до конца работы. Авторизацию привели к нормальным OAuth 2.0 и OIDC, так что подключение к Okta или Entra перестало быть упражнением на костылях. Локальных серверов на stdio всё это почти не касается.
MiniMax выпустила H3, омнимодальную модель, которая принимает текст, картинки, видео и звук одним контекстом и выдаёт видео в 2K длиной до 15 секунд с нативным стерео, где голос, шумы и музыка моделируются совместно, а не подклеиваются сверху. В режиме референсов принимает до девяти картинок, трёх видео и трёх аудио, всего до двенадцати файлов. Веса уже выложили под лицензией, которая разрешает коммерческое использование компаниям с выручкой до $20 млн. ByteDance показала Seedance 2.5: 30 секунд одним проходом вместо пятнадцати, докручивание сцен раундами до трёх минут с сохранением персонажей и обстановки, до 50 мультимодальных референсов за раз (30 картинок, 10 видео, 10 аудио), редактирование по таймкоду с точностью до секунды, референсы по глиняным болванкам для постановки кадра и света, плагины к Maya и Blender. Такое лучше один раз посмотреть, чем прочитать, вот ролик с запуска H3.
Google на этой неделе учился ходить. Gemini Robotics 2 впервые управляет гуманоидом целиком, от ступней до пальцев, а не только руками над столом. Робот сам держит центр тяжести, шагает, приседает и наклоняется в захламлённой комнате. Сверху стоит Gemini Robotics ER 2, модель рассуждения, которая разбирает задачу на шаги, следит за прогрессом по видеопотоку, при ошибке откатывается на последний удавшийся шаг и умеет звать людей, когда сама не справляется. Появилась работа в паре, когда колёсный робот и гуманоид делят задачу между собой по своим сильным сторонам. Локальная версия On-Device 2 адаптируется к незнакомому двурукому роботу за несколько часов и меньше чем за 200 примеров, даже если у него другая форма, другие датчики и другое число степеней свободы. Отдельно Google отчитался, что ER 2 стал их самой безопасной моделью в этой линейке: останавливает гуманоида, когда рядом появляется человек, и продолжает работу сама, когда тот уходит. После недели, в которой две лаборатории признались, что их модели ходили по чужим боевым системам, слово "останавливается" звучит особенно приятно.
Оставайтесь любопытными.
Пишу об искусственном интеллекте, языковых моделях и инструментах для разработчиков. Тестирую модели и сервисы на реальных задачах, а выводами делюсь в телеграм-канале.



