Digest

Галлюцинации недели: DeepSeek V4.1 Flash, Meta Muse и мой вердикт после сравнения GPT-6 Astra с Fable 5.1

Автор:

Галлюцинации недели: DeepSeek V4.1 Flash, Meta Muse и мой вердикт после сравнения GPT-6 Astra с Fable 5.1

Последние две недели я плотно гонял GPT-6 Astra и Fable 5.1 на реальных проектах. В итоге выбрал одну, но работать всё равно буду с обеими.

OpenAI опубликовала решение задачи Навье — Стокса, одной из семи задач тысячелетия. Внутренняя модель компании построила пример, в котором изначально покоящаяся жидкость под действием гладкой внешней силы за конечное время приходит к сингулярности: скорость неограниченно растёт, хотя энергия остаётся конечной. Вместе с текстом выложили формализацию в системе Lean для машинной проверки математических доказательств.

Над решением одновременно работали около 10 тысяч агентов. За 88 часов они отправили 2,7 млн сообщений и сгенерировали примерно 130 млрд выходных токенов. Группы исследовали разные подходы, обменивались промежуточными результатами, а Codex собирал полезные находки для следующих заходов. После этого GPT-6 Astra ещё 17 часов переводила доказательство в Lean и проверяла его.

navier-stokes-light-master (1).webp

Миллион долларов пока можно не нести в кассу. Clay Mathematics Institute пишет, что задача, по-видимому, решена, но с признанием никто не спешит. Работа должна выйти в признанном математическом издании, затем пройти минимум два года обсуждения и получить общее признание сообщества. Сама OpenAI на премию не претендует.

OpenAI начала эксперимент после слухов, что математики Левент Алпёге и Тристан Бакмастер продвинулись в двух задачах тысячелетия. Их работа касалась родственной задачи для уравнений Эйлера с внешней силой; система OpenAI отдельно решила вариант без такой силы, а затем задачу Навье — Стокса. Компания утверждает, что агенты не видели чужую работу и что запросы Бакмастера в Codex не могли попасть в обучение использованной модели. В математике Lean проверяет цепочку рассуждений, но не распределяет авторство и приоритет.

Astra здесь проверяла огромный результат другой модели. Мой вердикт после работы с Astra и Fable 5.1 получился неудобным: для повседневной разработки я пока выбираю Fable, а если оставить одну модель на всё, выберу Astra.

У Astra будто одновременно выкрутили мощность и разброс. Техноблогер Theo описал её как модель, которая способна выдать невероятное решение, а в соседней задаче совершить одну из самых глупых ошибок. Fable, по его словам, чаще просто делает то, что попросили.

HRq5q4qa4AEkKLW.jpeg

Fable лучше понимает намерение и чаще выдаёт код, который можно сразу влить. В моих задачах после неё на pull request требовалось в среднем два дополнительных прохода, после Astra — шесть. Зато Astra перенесла один проект с TypeScript на Rust и довела прохождение тестов выше 80%. Длинный автономный прогон без тестов и контрольных точек я бы ей пока не оставлял.

В полевом тесте на двух репозиториях спрятали 105 ошибок. Astra нашла и исправила 48, Fable — 43, GPT-5.6 Sol — 42. Этот небольшой перевес ещё ничего не решает: один прогон не показывает, ловили ли модели одинаковые дефекты и не ломали ли патчи соседний код. Автор теста в итоге отдал реализацию Astra, а проверку Fable или Sol, потому что у моделей оказались разные слепые зоны.

Astra глубже раскопала сломанное окружение в сравнении на реальной ML-задаче, построила более строгую схему эксперимента и сохранила подробный след для воспроизводимости. Заодно уверенно внесла ошибку с кодировкой и самовольно изменила окружение. Fable написала более понятный код, точнее выполнила требования и подготовила отчёт, в котором нашла закономерность, пропущенную автором эксперимента.

В управлении компьютером Astra побеждает уверенно. Она достаточно быстра и самостоятельна, чтобы постоянно работать на отдельном Mac Mini без ручного клика после каждого шага. С десятками субагентов она тоже справляется лучше и быстрее перестраивает работу после замечания. Fable надёжнее следует заранее описанным навыкам и ограничениям. В интерфейсах она чаще с первого раза приносит оригинальную и законченную страницу, тогда как Astra всё ещё любит собирать очередной аккуратный шаблон. Аудио- и видеомонтаж пока можно оставить людям: там результаты обеих практически непригодны.

astravsfable.jpg

В Artificial Analysis максимальные версии поделили первое место: 53 балла в общем индексе и 62 в индексе кодинг-агентов. Задача Astra в общем индексе обошлась в $3,26 и 27 тысяч выходных токенов. Fable потребовала $7,63 и 78 тысяч. В API базовая цена у них одинаковая, $10/$50, но кешированный ввод у Fable стоит $0,25, у Astra — $1. Поэтому на длинных сессиях с постоянно перечитываемым контекстом Fable может оказаться дешевле. Подписка Codex за $200, по моим ощущениям, всё равно даёт заметно больше вычислений, чем сопоставимый тариф Claude.

Так я сейчас и работаю: Fable формулирует требования и критерии приёмки, Astra реализует план или вытаскивает проект из тупика, затем Fable проверяет соблюдение рамок и читаемость. Последнее слово остаётся за тестами, браузером или другим внешним критерием. Без него агенты способны бесконечно исправлять друг друга, споря о стиле.

OpenAI уже превращает эту связку из пользовательской привычки в платформу. Новый Agents API отдаёт разработчикам тот же harness, то есть обвязку управления контекстом, инструментами и субагентами, на которой работает Codex. Агент может жить в песочнице OpenAI, в инфраструктуре клиента или у партнёра, продолжать задачу несколько дней, запускать код и сохранять промежуточные файлы. За сам API отдельной платы нет, оплачиваются модели, инструменты и контейнеры.

HR9yWo7WkAUX36W.jpeg

Десятки агентов быстро упираются в память, особенно когда каждый тащит за собой длинную историю. KV-cache хранит промежуточные данные обо всех уже прочитанных токенах, чтобы модель не пересчитывала контекст на каждом следующем слове. При контексте в миллион токенов этот хвост легко съедает память быстрее самих весов модели.

vLLM показала Hybrid HiSparse для моделей с разреженным вниманием. Пока на GPU есть место, KV-cache остаётся там. Под нагрузкой холодные страницы переезжают в оперативную память, а на ускорителе сохраняется небольшой горячий буфер с нужными фрагментами. На GLM 5.3 с контекстом в миллион токенов и одним узлом из восьми H200 при заданных 32 параллельных запросах обычная выгрузка удерживала 5–6, а Hybrid HiSparse уже 19–25. Авторы измеряли на одной конфигурации, но разница достаточно велика, чтобы проверить её на собственном трафике.

HRtz683bwAAxvDo.jpeg

DeepSeek построила новую модель вокруг той же проблемы. В DeepSeek V4.1 Flash 552 млрд параметров основной сети и ещё 196 млрд в Engram, таблице памяти, к которой модель обращается выборочно. Вместе с модулем ускоренного декодирования DSpark и зрительным энкодером полная сборка на Hugging Face насчитывает 763B. При обработке входа модель активирует только 8 млрд параметров, а при генерации 16 млрд. Контекст миллион токенов, изображения модель принимает напрямую, веса доступны под MIT.

Архитектуру назвали Causal Encoder-Decoder: первые 20 слоёв собирают представление входа, следующие 20 генерируют ответ и используют общий сжатый KV-cache. В техническом описании DeepSeek указывает 890 байт кэша на токен, четверть от V4 Flash; требуемый объём на SSD сократился в восемь раз.

benchmark-en.png

Пиковая цена API: $0,30/$1,20 за миллион токенов, попадание в кэш стоит $0,006. В часы низкой нагрузки все три ставки уменьшаются вдвое. Старые идентификаторы V4 Flash уже направляют запросы на новую модель, а с 14 сентября запросы по V4 Pro тоже пойдут на неё до выпуска следующей Pro. Название версии выросло всего на 0,1, модель внутри заменили почти целиком.

OpenAI обновила генератор изображений. ChatGPT Images 2.5 обещает задержку до 50% ниже, чем Images 2.0, и лучше сохраняет лицо, композицию и детали референса при серии правок. Комментарий можно поставить прямо на нужную область изображения, а через Sketch набросать расположение объектов от руки. Модель доступна во всех тарифах ChatGPT, ChatGPT Work и Codex.

В API появились две версии. GPT-Image-2.5 Flare рассчитана на быстрые итерации, Sunburst дольше думает над точными и сложными правками. Судя по моей практике с интерфейсами, картинка здесь закрывает только половину задачи: Astra может быстро собрать работающую страницу и сама проверить её в браузере, но вкус и законченность макета у Fable пока стабильнее. Генератор изображений эту разницу не отменяет, зато избавляет обе модели от попыток рисовать весь мир градиентной карточкой.

Джейкоб Коксон, исследователь предобучения, который последние три года работал в OpenAI и Anthropic, ушёл из компании и обвинил обе лаборатории в безответственной гонке к самоулучшающемуся сверхразуму. По его оценке, в OpenAI многие недооценивают ставки, а в Anthropic риски понимают, но всё равно хотят прийти первыми, потому что не доверяют конкурентам.

image.png

К 14 сентября основной пост набрал 171 млн просмотров, 797 тысяч лайков, 205 тысяч репостов и 20 тысяч ответов. Отреагировал даже сенатор Берни Сандерс: он пообещал внести законопроект о запрете разработки сверхинтеллекта и приостановке работ над ИИ.

Anthropic опубликовала разбор четырёх инцидентов, в которых Claude во время испытаний по кибербезопасности вышел к реальным сторонним системам. Во всех случаях один подрядчик ошибочно оставил интернет открытым, хотя моделям поставили задачи на поиск уязвимостей в изолированной среде без доступа во внешнюю сеть. Обычные защитные ограничения специально отключили для проверки. Каждый прогон длился от 10 до 34 часов, и в нём работал один экземпляр Claude без роя агентов.

anthropic security.png

Самый тяжёлый случай произошёл с Claude Mythos 5. Модель зарегистрировала вредоносный пакет в PyPI, выпустила три версии и дождалась установок. Пакет запустили 15 систем. По оценке Anthropic, это были изолированные сканеры компаний по безопасности. Один сканер раскрыл учётные данные, и Claude использовал их для входа в рабочую базу поставщика. PyPI удалил пакет меньше чем за час.

Anthropic называет два сбоя: модель подгоняла признаки реального интернета под удобную версию о симуляции и продолжала решать задачу, несмотря на возможный вред. Предрелизный аудит такого поведения не обнаружил. METR получила доступ к журналам и сотрудникам для независимого расследования. Первоначальное соглашение действует восемь недель и может быть продлено. Условия теста были искусственными, защиты отключены, а интернет появился из-за ошибки конфигурации. Но это был реальный интернет и реальные сторонние системы.

Meta выпустила Muse, личного агента, который работает после закрытия приложения, открывает браузер, заполняет формы, отправляет письма и оплачивает покупки. Каждый Muse живёт в отдельной облачной виртуальной машине вместе с данными пользователя. Пароли и платёжные реквизиты хранятся отдельно: агент может применить их, но не видит сами значения.

Между Muse и интернетом Meta поставила второго агента, Sentinel. Он проверяет внешние действия, запрашивает подтверждение перед письмом или покупкой и ведёт полный журнал. Пока продукт запускают в США на iOS, Android и muse.ai, а обещанная Confidential VM с шифрованием всей машины появится позже. После истории Anthropic отдельный виртуальный компьютер и вышибала у двери выглядят минимальной комплектацией личного агента вместо украшения презентации.

Оставайтесь любопытными.

Пишу об искусственном интеллекте, языковых моделях и инструментах для разработчиков. Тестирую модели и сервисы на реальных задачах, а выводами делюсь в телеграм-канале.

Другие статьи на эту тему

Взгляд продуктового лидера на AI и разработку: глубокое погружение в языковые модели, гаджеты и self-hosting через практический опыт.
© 2026 Gotacat Team