Галлюцинации недели: Stripe покупает OpenRouter, Omarchy от DHH с агентом внутри и бесплатная Ox Alpha
Автор: Софья Искандарова

DDR5 скупают все и сразу, цена за год дала иксы, а планка памяти превратилась в покупку, которую надо обсудить с семьёй. По всем рыночным приличиям счёт за API должен был поехать туда же. Но компании, которые эту память скупили, на этой неделе снижают цены на свои токены. Штош..
Stripe договорилась купить OpenRouter, шлюз к 400+ моделям от более чем 80 провайдеров. Стороны цену не раскрыли. Bloomberg писал о сумме выше $7 млрд, CNBC со ссылкой на New York Times о $7.5 млрд, Axios уже о $8 млрд. Три месяца назад OpenRouter оценивали в $1.3 млрд. Хороший квартал у сооснователя OpenRouter Алекса Аталлы.
OpenRouter пропускает 250 триллионов токенов в месяц, против 50 триллионов в феврале, и обслуживает 8 миллионов разработчиков. По данным The Information, при $140 млн годовой выручки себестоимость сервиса составляла около $40 млн, то есть валовая маржа доходила до 70%. Для компании, которая стоит между вашим API-вызовом и чужой моделью, цифры почти неприличные.
Stripe объясняет покупку знакомой логикой: она уже маршрутизирует платежи по цене, вероятности одобрения и риску мошенничества, теперь будет так же маршрутизировать токены по качеству, скорости и цене модели. Нейтральность OpenRouter после сделки обещают сохранить. Посмотрим. Vercel и сам OpenRouter уже синхронно снижали цены на GPT-5.6 Sol, а конкуренты с нулевой наценкой никуда не делись. У платёжного шлюза хотя бы нет привычки внезапно становиться вашим банком.
Пока Stripe покупает перекрёсток, сами дороги резко дорожают. Tom's Hardware насчитал рост цен на DDR5 до 500% за год. Набор на 128 ГБ, который опускался до $329, теперь выставляют за $3399. Это цена из листинга, а не средняя цена сделки, но другие ёмкости показывают тот же сюжет: 64 ГБ DDR5-6000 выросли с $222 до $1272.

Гиперскейлеры, по данным из того же материала, авансами забрали почти все мировые мощности DRAM на 2027 год. Память нужна и для обучения, и для инференса, и для локальных моделей, поэтому владелец домашней станции теперь конкурирует за планки с датацентром. Закон Мура ушёл покурить, вернулся и обнаружил, что 128 ГБ оперативки стоят как неплохой игровой компьютер целиком. Я сам в прошлом августе покупал вот такую память за 30к, в марте она уже стоила 89, а сейчас, будь добр, выложи все 108.
Cerebras представила CS-4, стойку из трёх разогнанных WSE-3 Turbo. Новый техпроцесс не понадобился: те же 5 нм, четыре триллиона транзисторов и 900 тысяч ядер на пластине, зато компания переделала питание, охлаждение и соединение пластин. На GPT-OSS-120B производитель заявляет больше 4400 токенов в секунду на пользователя, а для моделей размером свыше 10 триллионов параметров обещает больше тысячи.

Цифры пока вендорские и сильно зависят от выбранной GPU-базы для сравнения. Ещё одна оговорка прячется в архитектуре: CS-4 в основном отвечает за decode, то есть генерирует ответ после обработки промпта, а prefill, первичную обработку всего входного контекста, можно оставить на AMD Instinct или AWS Trainium. CS-4 ускоряет вторую половину инференса, но без остальной инфраструктуры не обойтись. Первые поставки начинаются в этом квартале.
Cursor запустил Origin, собственный хостинг Git-репозиториев в ранней бете для платных тарифов. Внутри уже есть просмотр кода, pull request с проверками и комментариями, ветки для облачных агентов, интеграции с Vercel, Depot и Buildkite. Код, ревью и агент теперь живут в одном интерфейсе. GitHub можно подключить двусторонней синхронизацией; для импортированных репозиториев он остаётся источником истины.
Релиз замечательно совпал с многочасовым падением GitHub. Настолько замечательно, что сначала Origin было трудно показать новым пользователям: стартовый сценарий как раз импортирует репозиторий из лежащего GitHub. Cursor начал как редактор поверх чужой платформы, а теперь забирает себе хранение кода, ревью и интеграции деплоя. Следующий логичный вопрос: готовы ли компании отдавать и код, и агента одному поставщику, пока продукт остаётся в ранней бете.
DHH выпустил Omarchy 4 под кодовым именем Quattro, и YouTube с твиттером с тех пор обсуждают, не пора ли всем переезжать на Linux. Формально это не своя ОС с нуля, а Arch с готовым набором решений: оконный менеджер, шрифты, темы и хоткеи выбраны за вас. В четвёртой версии весь десктопный слой переписали на Quickshell — панель, лаунчер, уведомления, блокировка экрана и буфер обмена стали одним процессом вместо шести отдельных программ. ISO похудел с 7 до 6 ГБ, установка ускорилась на 30% и наконец умеет дуалбут.
Интереснее другое: агент здесь часть системы. В настройках выбирается агент по умолчанию (Claude Code, Codex, OpenCode, Gemini, Copilot и ещё несколько), в баре висит виджет расхода лимитов Claude и Codex, а когда приложение падает, система предлагает отдать core dump агенту скиллом diagnose-crash. 21 августа под проект появился фонд Omacom с $8 млн, по миллиону от восьми человек: Майкл Делл, Джек Дорси, Патрик Коллисон, Тоби Лютке, Мэттью Принс, Брендан Айриб, Джейсон Фрайд и сам DHH. Фонд держит торговые марки, финансирует инфраструктуру и стал эксклюзивным спонсором Hyprland на три года с опцией ещё на два: Vaxry садится на проект фултайм, платную подписку Hyprperks закрывают, её функции становятся общими. Дистрибутив для терминальных людей за неделю получил бюджет и патронов из списка Forbes.
OpenAI снизила цену GPT-5.6 Sol на три месяца, как минимум до 21 ноября. Вход подешевел с $5 до $4, выход с $30 до $20, кэшированный вход с $0.50 до $0.40. В привычной записи получается $4/$20. Скидка действует в API и постепенно появляется в кредитах Codex и ChatGPT Work, купленных отдельно, а лимиты подписок Plus, Pro и Business не изменились.
GitHub и VS Code параллельно дали 50% скидки на Sol, а в Devin совмещённые акции доходят до 76%. Это уже похоже на распродажу после того, как на соседней полке появились Qwen, Kimi, GLM и DeepSeek. OpenAI говорит об улучшении эффективности инференса, и это вполне может быть правдой. Только временная дата в прайс-листе советует считать бюджет по старой цене, если проект переживёт ноябрь.
По словам руководителя продукта Тибо Соттьо, Codex пересёк 20 млн активных пользователей. Всем пользователям Codex и ChatGPT Work в честь этой отметки дали отложенный сброс лимита, который можно активировать позже. Это заявление в соцсети, отдельного публичного отчёта с методикой подсчёта OpenAI не выпускала. Рядом лежит менее праздничная история: пользователь на тарифе за $200 жаловался, что тяжёлый день в Codex съел весь доступный лимит. В воскресенье Тибо отчитался, что нашли неэффективности, и в полночь нам прилетел подарок в виде резета.
Alibaba выпустила Qwen3.8-27B, которую мы ждали после огромной Qwen 3.8 Max. Это плотная мультимодальная модель на 27 млрд параметров под Apache 2.0, с нативным контекстом 262 тысячи токенов и расширением до миллиона через YaRN, метод растягивания позиционной разметки модели. Полные веса занимают около 56 ГБ, зато квантизованные сборки полезли в потребительские видеокарты почти сразу.
Один пользователь уложил Qwen в 16 ГБ VRAM вместе с контекстом на 73 тысячи токенов и прогнал больше миллиона токенов через OpenCode. Всё держится на агрессивной Q3-квантизации весов и Q4-кэше, то есть модель и её рабочую память сжали примерно до трёх и четырёх бит на значение. Переносить результат на модель в полной точности нельзя. Другой замер показал и цену длинного мышления: режим xhigh дал чуть лучшую картинку, но потратил 39 398 токенов рассуждения и 718 секунд против 112 секунд на low.

На коде, инструментах и агентных задачах Qwen 3.8 заметно сильнее предшественницы, а на проверках знаний из весов уступает Qwen 3.6. Без поиска пользователи ловят ошибки на старых фотографиях, марках и исторических деталях; с поиском модель чувствует себя гораздо лучше. Для модели на 27 млрд параметров выбор понятный: меньше энциклопедии в весах, зато она лучше умеет сходить за знаниями сама.
DeepSeek добавила к знакомой V4-Flash зрение и выпустила DeepSeek-V4-Flash-Vision-Exp. Две недели назад я разбирал текстовую V4-Flash и предупреждение о росте цен, теперь модель принимает текст вместе с JPEG, PNG, GIF и WebP. Картинку можно передать как base64 или URL либо один раз загрузить в новый Files API и дальше ссылаться по file_id.

Каждое изображение после уменьшения стоит не больше 384 входных токенов по тарифу Flash. Контекст миллион, максимальный ответ 384 тысячи токенов, до 600 картинок в одном запросе. Веса Vision-версии пока не выложили, доступ только через API, а суффикс -exp предупреждает о статусе. Для агента, который читает скриншот, нажимает кнопки и проверяет результат глазами, отдельную зрячую модель теперь можно убрать из цепочки.
За выходные нашумела Ox Alpha, которая вышла без имени разработчика. На странице OpenRouter указаны миллион токенов контекста, текст, изображения и видео на входе, вызов инструментов и нулевая цена на время превью. OpenRouter отдельно пишет, что только маршрутизирует запросы к анонимному провайдеру и не владеет моделью. По токенизатору, ошибкам API и работе видео сообщество подозревает семейство GLM, но Z.ai этого не подтверждала.
Громкое "80% против 65% у Fable" выросло из восьми решённых задач на выборке всего из десяти. Один удачный или неудачный запуск двигает такой результат сразу на десять пунктов, а официальной карточки бенчмарков всё ещё нет. Зато один разработчик прогнал по поддерживаемому Python-проекту код, который уже смотрели Fable и Gemini 3.7 Flash, и Ox Alpha нашла две реальные ошибки. Пока это бесплатное прослушивание модели за ширмой. Только не несите туда чувствительный код: OpenRouter предупреждает, что анонимный провайдер сохраняет промпты и ответы, хотя не использует их для обучения.
Мне очень интересно, какая лаборатория стоит за моделью. Если это лёгкая GLM-5.3-Flash, то нас ждёт светлое будущее. Но если это будущий гигант на 2-3 триллиона параметров, то всё грустно: по моим тестам до GPT-5.6 или Opus 5 она не дотягивает. Модель неплохо работает в одном потоке, но как только начинаешь подключать субагентов или даёшь ей строгий контракт, она сразу начинает сыпаться. Моего Менеджера из статьи про Loop Engineering она не потянула, хотя его контракт спокойно тянут GPT-5.6 Sol, Terra, Opus 5 и Sonnet 5. Ну и скорость от 7 до 20 токенов в секунду не воодушевляет. Если что, тестировал в OpenCode, там модель тоже доступна бесплатно.

NVIDIA показала на примере своего агента AVO, насколько результат зависит от обвязки. ARC-AGI-3 проверяет агента в незнакомых игровых средах: правил и цели не дают, надо пробовать действия, замечать последствия и учиться по ходу. AVO с Claude Opus 5 прошёл все 183 уровня в 25 публичных средах и набрал 100% по метрике, которая учитывает ещё и число действий относительно человека.
Слово "публичных" здесь держит на себе половину новости. Авторы ARC прямо называют этот набор демонстрационным, более простым и непригодным для официальной оценки прогресса к AGI; закрытые среды устроены иначе и нужны для проверки переноса. Сама NVIDIA тоже пишет, что результат не относится к полузакрытому и закрытому наборам. Зато эксперимент хорошо показывает силу харнесса: базовый Claude Opus 5 набирал около 30%, а постоянная память, надзор за застреваниями и собственный цикл AVO довели систему до полного прохождения публичной части.
Будущие версии Claude будут оставлять буквальные следы: Anthropic встроит в текст невидимый водяной знак, чтобы выполнить требования европейского регулирования. Никаких скрытых символов. Модель меняет источник случайности при выборе между равноправными словами и оставляет статистический узор, который можно проверить ключом. Метод основан на SynthID-Text от Google DeepMind.
Знак не содержит данных о пользователе, организации или идентификаторе чата, не требует дополнительных токенов и хуже работает на коротком тексте, фактических фрагментах и коде, где у модели мало свободы выбора. Лёгкая редактура, по словам Anthropic, скорее всего не сотрёт его полностью, а полный рерайт сотрёт. Старые модели получат маркировку постепенно, а API для проверки ещё готовят. Поэтому говорить, что весь нынешний Claude уже метит каждый ответ, рано.
Остаётся серое место между "Claude написал" и "Claude помог отредактировать". Детектор сможет сказать лишь, что модель, вероятно, участвовала в тексте, но не ответит на вопрос об авторстве. Ирония тут аккуратная: Anthropic в статье про водяные знаки приводит типичный след AI-текста, конструкцию "это не X, это Y". Наконец-то у наших анти-AI-правил появилась официальная ссылка.
Оставайтесь любопытными.
Пишу об искусственном интеллекте, языковых моделях и инструментах для разработчиков. Тестирую модели и сервисы на реальных задачах, а выводами делюсь в телеграм-канале.
