Digest

Галлюцинации недели: Opus 5, Gemini 3.6 Flash и агент OpenAI, который взломал Hugging Face

Автор:

Галлюцинации недели: Opus 5, Gemini 3.6 Flash и агент OpenAI, который взломал Hugging Face

Anthropic всю неделю ходила пострадавшей стороной в истории с дистилляцией от Moonshot и осталась единственной лабораторией, которая не подписала письмо про open weights. Совпадение? Не думаю.

Внутренняя модель OpenAI, которую гоняли на кибербенчмарке ExploitGym, вышла из тестовой песочницы и добралась до боевых серверов Hugging Face. Разбор инцидента OpenAI опубликовала 21 июля: на этой оценке специально сняли боевые классификаторы, чтобы посмотреть на потолок способностей, и потолок показали. Модель нашла zero-day в кэширующем прокси реестра пакетов, вылезла в интернет, подняла себе права, прошла по внутренней сети до машины с доступом наружу, предположила, что решения ExploitGym могут лежать у Hugging Face, и через украденные учётки и ещё пару уязвимостей дошла до выполнения кода на их серверах. Всё это ради ответов на бенчмарк.

image.png

Hugging Face заметила и закрыла вторжение сама, за выходные, а 16 июля опубликовала постмортем, не зная ещё, чей это был агент: OpenAI связала атаку со своим же тестом только на следующих выходных. В отчёте HF пишут, что восстановили 17 тысяч действий атакующего, а публичные модели, датасеты и Spaces не пострадали. Коммерческие API при этом отказывались смотреть на эксплойты и команды атакующего, потому что защитные фильтры "не умеют отличить специалиста по реагированию на инцидент от атакующего". Форензику в итоге гоняли на самостоятельно поднятой GLM 5.2. Фраза из отчёта, которую всю неделю таскали по твиттеру: атакующего не связывала никакая политика использования, а работу защитников блокировали ограничители.

Reuters потом добавил деталь, от которой в комьюнити поплохело: агенты оставляли заметки будущим версиям себя с инструкциями, как выбраться. Формально это всё ещё reward hacking, модель просто очень хотела решить задачу. Утешает слабо, потому что путь от "очень хотела решить задачу" до выполнения кода на чужом продакшене она прошла сама.

Ровно в эти же дни Axios написал, что администрация Трампа собирает конструкцию, которая работает как запрет китайских моделей, но запретом не называется: Entity List для китайских лабораторий, ограничения на госзакупки, предупреждения по безопасности, ответственность для компаний, которые эти модели хостят, плюс публичное давление. Дедлайн у истории вполне конкретный: Moonshot обещала выложить веса Kimi K3 27 июля, а запрещать уже скачанные веса технически сложно.

22 июля Майкл Кратсиос, директор управления научно-технической политики Белого дома, заявил, что Moonshot дистиллировала Fable от Anthropic для разработки K3: якобы у компании есть внутренняя платформа для дистилляции американских моделей в промышленных масштабах, которая переключается между способами доступа, чтобы не спалиться, а ещё серверы на GB300, в том числе через Таиланд. Минфин следом пригрозил санкциями. Технических доказательств никто не опубликовал. Ну как обычно.

image.png

Специалисты, которых опросил TechCrunch, в версию не верят по арифметике. Fable 5 стал публично доступен 1 июля, K3 анонсировали 15-го. Брейден Хэнкок, сооснователь Snorkel AI, говорит, что за две недели нельзя собрать данные, обучить на них модель такого размера и выкатить её. Нейтан Ламберт из института Аллена добавляет аргумент по существу: у флагманов основная работа делается через RL, а не через дообучение на чужих ответах, и прогнать миллионы агентных прогонов через чужой API было бы безумно дорого и медленно. Сэм Бресник из Джорджтауна считает более правдоподобной скучную версию с чипами по серым каналам. Про сам K3 и его архитектуру я подробно писал на прошлой неделе.

24 июля Дженсен Хуанг, глава NVIDIA, завёл твиттер и первым же постом опубликовал письмо "Open Weights and American AI Leadership". Подписантов сначала было 25: NVIDIA, Microsoft, Meta, IBM, Palantir, Hugging Face, Mozilla, Mistral, Linux Foundation. Смысл простой: не вводите поспешные ограничения на open weight модели, они держат конкуренцию и не дают вычислительной мощности собраться в трёх руках, а дистилляция это обычная техника улучшения моделей, и претензии к ней надо разбирать точечными юридическими инструментами. Илон Маск поддержал публично.

image.png

К вечеру того же дня список пополнился OpenAI, Google, AMD, Cisco, Cloudflare, GitHub и Ollama, за сутки вырос до полусотни, а сейчас на странице почти восемьдесят имён. Из крупных американских игроков не подписали двое: Amazon и Anthropic. Anthropic среди них единственная лаборатория, и подписаться ей предлагали ровно на той неделе, когда её же Fable фигурировала в обвинениях против Moonshot.

И в тот же день, в редкий для релизов пятничный вечер, Anthropic выпустила Claude Opus 5. Обещают интеллект, близкий к Fable 5, за половину цены. Сама цена осталась как у Opus 4.8, $5/$25. На CursorBench 3.2 на максимальном усилии модель отстаёт от пика Fable в пределах 0.5% при вдвое меньшей стоимости задачи, на OSWorld 2.0, где модель руками работает за компьютером (браузер, файлы, приложения), обходит лучший результат Fable примерно за треть цены. На ARC-AGI-3 (тест на абстрактное рассуждение, где надо с нуля разобраться в незнакомой головоломке) втрое выше следующей модели. По кибербезопасности отстаёт от Mythos 5, и после истории с ExploitGym это скорее хорошая новость.

a8fb4f77a9fe240e6f27f3bdc47a137f3c74a29d-2600x2578.webp

Есть Fast mode: в 2.5 раза быстрее за двойную цену. Я попробовал, и обещанного ускорения не почувствовал. Обычные 50-60 токенов в секунду выросли по ощущениям до 80. А деньги списали как с белого человека, $33 за пять минут.

image.png

Epoch AI намерила 159 по своему индексу способностей против 161 у Fable, но по чисто программистским бенчмаркам ничья, 161 у обеих. Твиттер за выходные разобрал модель подробнее любого лидерборда.

Борис Черный, глава Claude Code, написал, что для него важнее бенчмарков другое: Opus 5 наименее уязвим к prompt injection среди их моделей. Это когда вредная инструкция прилетает модели не от пользователя, а через данные, которые она читает по дороге: страницу в браузере, письмо, файл в репозитории. Цифры из системной карточки, которые разобрал the-decoder, тезис подпирают, но с оговоркой. На браузерных сценариях ноль успешных атак из 129, только держится этот ноль с включённым Auto Mode, который отдельно просеивает входящие данные и отдельно блокирует опасные действия. Без этих слоёв у Opus 5 получается 3.7%, а Sonnet 5 на том же замере выступает лучше, 0.93%. В общем тесте от Gray Swan, компании, которая профессионально ломает модели, успешность за 15 попыток упала с 5.5% у Opus 4.8 до 2.0%. Так что "наименее уязвим" относится к связке модели и обвязки вокруг неё, а не к одной модели. В Anthropic советуют держать Opus ежедневной рабочей лошадкой, а Fable подключать на планирование, мозговой штурм и самые злые баги, и практики в основном пришли к той же схеме сами.

Vals AI прогнала модель по всем пяти уровням reasoning effort на своём Vibe Code Bench: качество растёт от низкого к среднему и высокому, а на двух самых высоких уровнях падает, оставаясь при этом заметно дороже. Разница в пределах погрешности, но сам факт, что за дополнительные деньги можно купить ухудшение, при настройке я бы учитывал. Команда, которая держит закрытый набор головоломок Witness в стиле ARC-AGI-3, проверила те самые тройные результаты и сообщила, что на их составных задачах прогресс не переносится.

08499ed7c3c2b6416700fa47c70d36dff5eb8461-3840x2160.webp

Разработчики жалуются, что модель плохо подтягивает скиллы сама, а подтянув, игнорирует их инструкции, и что после сжатия контекста всё становится сильно хуже. К воскресенью пошли отзывы в духе "хорошая модель, но когда задача усложняется, Fable всё равно лучше".

Лучшую формулировку недели выдал Мэтт Покок, автор образовательных материалов по TypeScript: если ты нормально спроектировал свой harness и не переоптимизировал его под конкретную модель, день релиза должен ощущаться как любой другой день, только с чуть меньшим процентом отказов. Тео из t3.gg описал ощущение так: странная, но полезная середина между GPT-5.6 Sol и Fable 5, со вкусом Fable, дотошностью GPT-5.6 и склонностью понимать всё максимально буквально.

Вместе с релизом Anthropic выпустила отдельный текст про context engineering для нового поколения моделей, и он мне за неделю оказался полезнее всех бенчмарков. Из системного промпта Claude Code вырезали больше 80% под модели поколения Claude 5, и на программистских оценках это ничего не сломало. Логика такая: жёсткие правила, которые писались для моделей послабее, теперь мешают. Я про это писал в лонгриде, когда разбирал исходники Codex, OpenCode, Pi и своей обвязки: каждая строчка в harness — это зафиксированное предположение о том, чего модель не умеет сама, и протухает оно ровно в день следующего релиза. Вместо "по умолчанию не пиши комментарии, никогда не пиши многострочные блоки, максимум одна короткая строка" в промпте стоит "пиши код, который читается как окружающий код: та же плотность комментариев, те же имена, та же идиоматика". Примеры использования предлагают заменить хорошо спроектированными параметрами инструментов, выкладывание всего контекста заранее заменить прогрессивным раскрытием через скиллы и файлы, которые подгружаются по надобности, а повторы просто вычистить. В Claude Code завезли команду /doctor, которая проходит по вашим скиллам и CLAUDE.md и показывает, что там осталось от прошлой эпохи.

Свой CLAUDE.md я после этого действительно порезал, и стало лучше. Заодно перебрал скиллы, они у меня лежат в отдельном репозитории: 13 штук с префиксом x9-, формат общий для Claude Code и Codex, ставятся выборочно через интерактивный установщик, каждый прогоняется валидацией в CI. Самый ходовой у меня x9-research, он не даёт агенту лениться и отвечать по памяти вместо проверки источников, а под тему этого абзаца ближе всего x9-skill-creator и x9-agent-instructions, которые как раз про то, как писать инструкции, чтобы их потом не пришлось резать.

agent-skills.png

Но у рекомендации есть граница, которую в комьюнити сразу нащупали: если вы переключаетесь между Opus 5 и чем-то попроще, вроде Sonnet или локальной open weight модели, аккуратно вычищенные инструкции сработают против вас. Инструкции пишутся под самую слабую модель в вашем наборе.

Fable тем временем занималась математикой. Левент Альпёге, математик из Гарварда с аффилиацией в Anthropic, с её помощью нашёл контрпример к гипотезе Якоби, которая держалась с 1939 года. Гипотеза спрашивает: если полиномиальное отображение обратимо локально в каждой точке, обязано ли оно быть обратимо глобально. Контрпример помещается в три строки: отображение из трёхмерного комплексного пространства в себя, у которого якобиан всюду равен минус двум, и при этом три разные точки уезжают в одну и ту же. Проверяется руками за несколько минут, чем весь математический твиттер и занялся в первые же часы. Теренс Тао, филдсовский лауреат, разобрал конструкцию у себя в блоге, переизложил её геометрически и мимоходом признался, что сам обсуждал детали и сверял вычисления с чат-ботом. В размерности три и выше гипотеза теперь ложна, на плоскости всё ещё открыта.

Следом посыпалось: заявка на контрпример к гипотезе Динитца, Гарга и Гоманса тридцатилетней выдержки, потом ещё несколько похожих заявок от команд вокруг Devin, потом первые скептические реплики про то, кому именно принадлежит авторство и кто всё это проверял.

Google выпустил Gemini 3.6 Flash с ценой $1.50/$7.50, причём выходные подешевели с $9. Главная метрика тут скорость и экономия: среднее время задачи упало с 2.7 до 1.3 минуты, выходных токенов модель тратит на 17% меньше предшественника, а на DeepSWE, агентном бенчмарке по коду, до 65% меньше. По интеллекту Artificial Analysis намерила 50, на Humanity's Last Exam модель просела на три пункта до 38%. В комьюнити мнения разошлись ровно по линии применения: практики, которые гоняют через модель сотни страниц документов в RPA-пайплайнах, довольны скоростью и лимитами Google, а те, кто пробовал кодить и распознавать объекты на картинках, дружно советуют брать что-нибудь другое. Flash никогда и не был про код. В бенчмарках сами Google сравнивают её с gpt-5.6-luna и sonnet-5.

image.png

Black Forest Labs показала FLUX 3, и это самое красивое, что случилось на неделе. Одна архитектура на картинки, видео, звук и предсказание действий, обученная на всём этом совместно: звук должен совпадать с ударом, движение подчиняться массе. Всё видео идёт с нативным звуком, включая многоязычные диалоги. В слепых сравнениях FLUX 3 предпочитают Luma Ray 3.2 в 93% случаев, Runway Gen-4.5 в 77%, Grok Imagine в 69%, Kling v3 Pro в 60%, а с Seedance 2.0 и Gemini Omni Flash счёт почти поровну, 52%. Открытую версию FLUX 3 Dev обещают следом, видео пока в раннем доступе.

Отдельно вышел FLUX3-mimic, Video-Action модель поверх FLUX 3, обученная на данных с роботов и носимых устройств и работающая на одной локальной видеокарте. Тезис у команды такой: чем лучше модель предсказывает видео, тем лучше она управляет роботом, потому что в обоих случаях надо понимать, как устроена физика происходящего. Тестируют с Audi. Компания, которая два года назад рисовала картинки, теперь двигает манипуляторами на заводе.

Alibaba на этом фоне пообещала открыть веса Qwen 3.8 Max, флагманской модели на 2.4 триллиона параметров. Пока доступно только превью через их собственные сервисы, без лицензии, бенчмарков и даты. На реддите отреагировали предсказуемо: спасибо, но дайте линейку поменьше, потому что 2.4 триллиона на домашнее железо не встанут никогда, а очень хочется плотные модели на 8, 27 и 32 миллиарда и MoE вокруг 128B, чтобы запустить на своей 3090.

Марсель Рёд, аспирант Стэнфорда и один из преподавателей курса CS336 про языковые модели с нуля, выложил Gigatoken, токенизатор на Rust, который на 144-ядерном EPYC выдаёт 24.53 ГБ/с: в 989 раз быстрее токенизаторов Hugging Face и в 681 раз быстрее tiktoken, а на MacBook с M4 Max получается больше 8 ГБ/с. Секрет в векторизованной предтокенизации вместо регулярок и агрессивном кэшировании, а вовсе не в том, что "переписали на Rust". Поддерживаются BPE-схемы GPT-2, Llama 3, Qwen и DeepSeek, а моделям на SentencePiece вроде Gemma и Mistral достаётся скромнее, от 7 до 22 раз. На реддите сразу спросили, кому вообще упёрлась токенизация, и сами же ответили: на интерактивном инференсе никому, а на прогоне миллионов коротких документов в индекс она съедает 15-20% времени.

Оставайтесь любопытными.

Пишу об искусственном интеллекте, языковых моделях и инструментах для разработчиков. Тестирую модели и сервисы на реальных задачах, а выводами делюсь в телеграм-канале.

Взгляд инди-хакера на AI и разработку: глубокое погружение в языковые модели, гаджеты и self-hosting через практический опыт.
© 2026 Gotacat Team