Digest

Галлюцинации недели: Claude Opus 5.5, GPT-6 Sol и опрос о том, как вы используете ИИ на работе

Галлюцинации недели: Claude Opus 5.5, GPT-6 Sol и опрос о том, как вы используете ИИ на работе

Написать запрос, проверить ответ, переделать результат. Нам стало интересно, сколько рабочего времени ИИ экономит после всех этих действий и что происходит с качеством. Давайте посчитаем вместе. Но сначала расскажем, что произошло за прошедшую неделю.

Anthropic выпустила Claude Opus 5.5 для Claude Code и API. Компания обещает уровень Fable 5.1 для большинства задач и называет главным улучшением не очередные проценты в одном тесте, а стоимость обычной работы: при стандартных настройках задача должна обходиться примерно на 40% дешевле, чем на Opus 5. Прейскурант API снизился на 20%, до $4/$20 за миллион токенов. Чтение из кеша $0,20 вместо $0,50.

image.png

Artificial Analysis прогнала модель на пяти уровнях reasoning effort: Max набрал 58 баллов в составном индексе задач на рассуждение, код и работу с документами, но потратил $5,98 на задачу против $5,86 у Opus 5 на его максимуме. Новая модель генерировала примерно 119 тысяч выходных токенов на задачу вместо 73 тысяч. То есть цена токена упала, а счёт за самый напряжённый прогон не снизился.

Artificial Analysis Intelligence Index (28 Sep '26).png

В материалах Anthropic особенно заметен сдвиг к агентной разработке. На Terminal-Bench 4.0, где агент выполняет многошаговые задачи в терминале, компания сообщает 66,4% для Opus 5.5 на предпоследнем уровне reasoning effort против 52,3% для Opus 5 в своём прогоне. Эти цифры получены с разными режимами усилий и в собственной конфигурации теста. Opus теперь можно использовать на Medium, а более дорогой режим включать там, где задача встала колом.

OpenAI выпустила GPT-6 Sol и Luna. Обе наследуют наработки Astra, но рассчитаны на больший объём повседневных запросов. В коротком контексте стандартная цена API составляет $2/$10 для Sol и $0,10/$0,50 для Luna за миллион токенов; при длинном контексте будет дороже. Модели появились в Codex, ChatGPT Work и API, а Luna доступна и на бесплатном тарифе.

AutomationBench.png

Artificial Analysis отмечает улучшение соотношения цены и качества у Sol и Luna. Для длинного исследования или сложной миграции я бы сначала смотрел на успешность задачи в конкретной обвязке и полный расход токенов.

Xiaomi ответила на ценовую гонку: веса MiMo-V2.6-Pro-RL и MiMo-V2.6-Flash-RL опубликованы под MIT. У старшей модели 1,02 трлн параметров суммарно, но на каждом токене задействуется 42 млрд, это MoE, где из большой сети включается только нужная часть. Модель принимает текст, изображения, аудио и видео, контекст 1 млн токенов.

Xiaomi описывает единый цикл RL: модель обучали на обратной связи за действия в программировании, работе с инструментами, визуальных и киберзадачах. Часть рецептов и сред команда выложила вместе с весами. В измерениях Artificial Analysis MiMo получила 46 баллов общего индекса при примерно $0,13 на задачу их набора.

SpaceXAI представила Grok 4.7 как модель для длинных кодинг-сессий и работы с информацией, сохранив заявленные цену и скорость уровня 4.6. Artificial Analysis дала ей 46 баллов в общем индексе, всего на два больше предыдущей версии. Зато в индексе кодинг-агентов Grok вместе с собственной обвязкой Grok Build поднялась с 47 до 56. В других задачах картина неровная, у аналитиков есть улучшения в терминале и просадки в проверке длинного контекста и автоматизации приложений. На задачу модель тратила заметно больше токенов.

HSwLcNqXIAAwNtz.png

У Jev появился показательный сосед — открытый CLM. Про Jev мы писали на прошлой неделе и разбирали API решений и пятнадцать проектов на нём.

CLM строит представления состояния и возможных действий отдельно, сравнивает их и отдаёт оценки через интерфейс, совместимый с TypeSafe. В основе опубликованной версии Qwen3-8B; код доступен под Apache-2.0, так что его можно развернуть у себя и проверить на собственных задачах. Авторы сообщают о скорости до девяти раз выше Jev в отдельных сценариях и высоких результатах в проверке решений кодинг-агентов. Их тесты собраны на небольших отложенных наборах, общего независимого экзамена для всей категории пока нет.

Meta рассказала на Connect о следующих возможностях Muse. О первом запуске агента мы писали две недели назад. У Muse появится собственный почтовый адрес, агенту можно будет писать напрямую. Компания анонсировала голосовой разговор и новые подключения к магазинам и рабочим сервисам. Meta также обещает вывести Muse на свои очки в ближайшие месяцы, агент сможет учитывать то, на что смотрит владелец.

Мы ранее писали про отдельную виртуальную машину Muse и проверяющего агента Sentinel. Теперь масштаб последствий этой схемы понятнее. Агент с собственным почтовым адресом, доступом к покупке и камерой на очках получит куда больше поводов ошибиться, чем чат-бот в отдельном окне. Meta описывает подтверждение чувствительных действий и разграничение доступа к паролям. Это полезные инженерные решения, но проверить их по презентации нельзя; настоящую надёжность покажут задачи и сбои после расширения доступа.

Gemini 3.8 Flash вышла ещё 2 сентября. Теперь к ней накопились измерения, позволяющие понять место модели между дорогими флагманами и совсем дешёвыми помощниками. Artificial Analysis даёт 41 балл общего индекса и около 300 выходных токенов в секунду при измерении через API Google. Быстрый вывод не равен быстрому первому ответу, на этой же странице TTFT (время до первого токена) заметно выше медианы сопоставимых моделей.

На ARC-AGI, наборе задач на поиск правил в незнакомых головоломках, Flash решила 89,2% заданий второй версии при высоком reasoning effort. На третьей версии — уже 10,4% со стандартной обвязкой и 35% с обвязкой поставщика, которая сохраняет состояние рассуждения между вызовами.

Qwen-Image 2.1, представленная 20 сентября, объединяет генерацию и редактирование в одной модели. В генеративном компоненте 7 млрд параметров; модель умеет сразу выдавать изображение с прозрачным фоном, принимать до десяти референсов и менять выбранные области.

example-15.jpg

С весами есть существенное условие. Текст лицензии на Hugging Face разрешает использовать материалы модели для исследований и оценки, а для коммерческого применения требует отдельной лицензии. В обсуждении на Reddit отдельно спорили о правах на готовые изображения.

Интересно, а вот так она могёт?

Коллаж_3x2.jpg

Hugging Face представила кандидат версии tokenizers v1. Токенизатор превращает текст в номера фрагментов, которые понимает модель. На Apple M4 Max команда измерила ускорение этой операции в 3–30 раз относительно версии 0.23 на десяти семействах моделей при одном потоке. Идентификаторы токенов при этом сохраняются, оптимизация не должна незаметно изменить вход модели. Повторное использование уже разобранных слов и буферов сокращает лишнюю работу; для одинаковых префиксов выгода выше, для непохожих текстов ниже.

photo_2026-09-28 17.59.14.jpeg

Пока это предварительная Rust-версия, полный Python API и стабильная 1.0 ещё в работе. Бежать и переписывать действующий сервис ради максимальной цифры из бенчмарка рано. Но если в вашем пайплайне токенизация уже стала узким местом, авторы опубликовали методику и команду для повторения замеров на своём железе.

Ребята, у нас небольшой анонс! Мы запустили исследование «ИИ на работе: экономия времени или новая нагрузка?». Нам стало интересно, сколько времени ИИ экономит на реальных рабочих задачах с подготовкой, проверкой и переделками. Что при этом происходит с качеством задач и общей нагрузкой на сотрудников?

Принять участие (1).png

Если вы сейчас трудоустроены в России или за её пределами, расскажите, как проходит ваша ИИ-трансформация. Поделитесь опытом, даже если совсем не используете ИИ в работе. Анкета займёт около 10 минут, всё анонимно, итоги будем подводить в обобщённом виде. Результаты опубликуем в конце октября.

И да, это не реклама, исследование проводим мы, Контролируемые галлюцинации. Нам правда интересно замерить реальный эффект от ИИ, а не показать красивую цифру в отчётах для стейкхолдеров.

Оставайтесь любопытными.

Пишу об искусственном интеллекте, языковых моделях и инструментах для разработчиков. Тестирую модели и сервисы на реальных задачах, а выводами делюсь в телеграм-канале.

Взгляд на AI и разработку: глубокое погружение в языковые модели, гаджеты и self-hosting через практический опыт.
© 2026 Gotacat Team