
Коротко о главномРазвернутьСвернуть
- Последние две недели я плотно гонял GPT-6 Astra и Fable 5.
- В итоге выбрал одну, но работать всё равно буду с обеими.
- OpenAI опубликовала решение задачи Навье — Стокса , одной из семи задач тысячелетия.
Последние две недели я плотно гонял GPT-6 Astra и Fable 5.1 на реальных проектах. В итоге выбрал одну, но работать всё равно буду с обеими.
OpenAI опубликовала решение задачи Навье — Стокса , одной из семи задач тысячелетия. Внутренняя модель компании построила пример, в котором изначально покоящаяся жидкость под действием гладкой внешней силы за конечное время приходит к сингулярности: скорость неограниченно растёт, хотя энергия остаётся конечной. Вместе с текстом выложили формализацию в системе Lean для машинной проверки математических доказательств.
Над решением одновременно работали около 10 тысяч агентов. За 88 часов они отправили 2,7 млн сообщений и сгенерировали примерно 130 млрд выходных токенов. Группы исследовали разные подходы, обменивались промежуточными результатами, а Codex собирал полезные находки для следующих заходов. После этого GPT-6 Astra ещё 17 часов переводила доказательство в Lean и проверяла его.
Миллион долларов пока можно не нести в кассу. Clay Mathematics Institute пишет , что задача, по-видимому, решена, но с признанием никто не спешит. Работа должна выйти в признанном математическом издании, затем пройти минимум два года обсуждения и получить общее признание сообщества . Сама OpenAI на премию не претендует.
OpenAI начала эксперимент после слухов, что математики Левент Алпёге и Тристан Бакмастер продвинулись в двух задачах тысячелетия. Их работа касалась родственной задачи для уравнений Эйлера с внешней силой; система OpenAI отдельно решила вариант без такой силы, а затем задачу Навье — Стокса. Компания утверждает, что агенты не видели чужую работу и что запросы Бакмастера в Codex не могли попасть в обучение использованной модели. В математике Lean проверяет цепочку рассуждений, но не распределяет авторство и приоритет .
Astra здесь проверяла огромный результат другой модели. Мой вердикт после работы с Astra и Fable 5.1 получился неудобным: для повседневной разработки я пока выбираю Fable, а если оставить одну модель на всё, выберу Astra.
У Astra будто одновременно выкрутили мощность и разброс . Техноблогер Theo описал её как модель, которая способна выдать невероятное решение, а в соседней задаче совершить одну из самых глупых ошибок. Fable, по его словам, чаще просто делает то, что попросили .
Fable лучше понимает намерение и чаще выдаёт код, который можно сразу влить . В моих задачах после неё на pull request требовалось в среднем два дополнительных прохода, после Astra — шесть. Зато Astra перенесла один проект с TypeScript на Rust и довела прохождение тестов выше 80%. Длинный автономный прогон без тестов и контрольных точек я бы ей пока не оставлял.
В полевом тесте на двух репозиториях спрятали 105 ошибок. Astra нашла и исправила 48, Fable — 43, GPT-5.6 Sol — 42. Этот небольшой перевес ещё ничего не решает: один прогон не показывает, ловили ли модели одинаковые дефекты и не ломали ли патчи соседний код. Автор теста в итоге отдал реализацию Astra, а проверку Fable или Sol , потому что у моделей оказались разные слепые зоны .
Astra глубже раскопала сломанное окружение в сравнении на реальной ML-задаче , построила более строгую схему эксперимента и сохранила подробный след для воспроизводимости. Заодно уверенно внесла ошибку с кодировкой и самовольно изменила окружение. Fable написала более понятный код , точнее выполнила требования и подготовила отчёт, в котором нашла закономерность, пропущенную автором эксперимента.
В управлении компьютером Astra побеждает уверенно. Она достаточно быстра и самостоятельна, чтобы постоянно работать на отдельном Mac Mini без ручного клика после каждого шага. С десятками субагентов она тоже справляется лучше и быстрее перестраивает работу после замечания. Fable надёжнее следует заранее описанным навыкам и ограничениям. В интерфейсах она чаще с первого раза приносит оригинальную и законченную страницу, тогда как Astra всё ещё любит собирать очередной аккуратный шаблон. Аудио- и видеомонтаж пока можно оставить людям: там результаты обеих практически непригодны .
В Artificial Analysis максимальные версии поделили первое место : 53 балла в общем индексе и 62 в индексе кодинг-агентов. Задача Astra в общем индексе обошлась в $3,26 и 27 тысяч выходных токенов. Fable потребовала $7,63 и 78 тысяч. В API базовая цена у них одинаковая, $10/$50, но кешированный ввод у Fable стоит $0,25, у Astra — $1. Поэтому на длинных сессиях с постоянно перечитываемым контекстом Fable может оказаться дешевле. Подписка Codex за $200, по моим ощущениям, всё равно даёт заметно больше вычислений , чем сопоставимый тариф Claude.
Так я сейчас и работаю: Fable формулирует требования и критерии приёмки, Astra реализует план или вытаскивает проект из тупика, затем Fable проверяет соблюдение рамок и читаемость. Последнее слово остаётся за тестами, браузером или другим внешним критерием . Без него агенты способны бесконечно исправлять друг друга, споря о стиле.
OpenAI уже превращает эту связку из пользовательской привычки в платформу. Новый Agents API отдаёт разработчикам тот же harness, то есть обвязку управления контекстом, инструментами и субагентами, на которой работает Codex. Агент может жить в песочнице OpenAI, в инфраструктуре клиента или у партнёра, продолжать задачу несколько дней , запускать код и сохранять промежуточные файлы. За сам API отдельной платы нет, оплачиваются модели, инструменты и контейнеры.
Десятки агентов быстро упираются в память, особенно когда каждый тащит за собой длинную историю. KV-cache хранит промежуточные данные обо всех уже прочитанных токенах, чтобы модель не пересчитывала контекст на каждом следующем слове. При контексте в миллион токенов этот хвост легко съедает память быстрее самих весов модели.
vLLM показала Hybrid HiSparse для моделей с разреженным вниманием. Пока на GPU есть место, KV-cache остаётся там. Под нагрузкой холодные страницы переезжают в оперативную память, а на ускорителе сохраняется небольшой горячий буфер с нужными фрагментами. На GLM 5.3 с контекстом в миллион токенов и одним узлом из восьми H200 при заданных 32 параллельных запросах обычная выгрузка удерживала 5–6, а Hybrid HiSparse уже 19–25. Авторы измеряли на одной конфигурации, но разница достаточно велика, чтобы проверить её на собственном трафике .
DeepSeek построила новую модель вокруг той же проблемы. В DeepSeek V4.1 Flash 552 млрд параметров основной сети и ещё 196 млрд в Engram , таблице памяти, к которой модель обращается выборочно. Вместе с модулем ускоренного декодирования DSpark и зрительным энкодером полная сборка на Hugging Face насчитывает 763B. При обработке входа модель активирует только 8 млрд параметров, а при генерации 16 млрд. Контекст миллион токенов, изображения модель принимает напрямую, веса доступны под MIT.
Архитектуру назвали Causal Encoder-Decoder : первые 20 слоёв собирают представление входа, следующие 20 генерируют ответ и используют общий сжатый KV-cache. В техническом описании DeepSeek указывает 890 байт кэша на токен, четверть от V4 Flash; требуемый объём на SSD сократился в восемь раз.
Пиковая цена API: $0,30/$1,20 за миллион токенов, попадание в кэш стоит $0,006. В часы низкой нагрузки все три ставки уменьшаются вдвое. Старые идентификаторы V4 Flash уже направляют запросы на новую модель, а с 14 сентября запросы по V4 Pro тоже пойдут на неё до выпуска следующей Pro. Название версии выросло всего на 0,1, модель внутри заменили почти целиком .
OpenAI обновила генератор изображений. ChatGPT Images 2.5 обещает задержку до 50% ниже, чем Images 2.0, и лучше сохраняет лицо, композицию и детали референса при серии правок. Комментарий можно поставить прямо на нужную область изображения, а через Sketch набросать расположение объектов от руки. Модель доступна во всех тарифах ChatGPT, ChatGPT Work и Codex.
В API появились две версии. GPT-Image-2.5 Flare рассчитана на быстрые итерации, Sunburst дольше думает над точными и сложными правками. Судя по моей практике с интерфейсами, картинка здесь закрывает только половину задачи: Astra может быстро собрать работающую страницу и сама проверить её в браузере, но вкус и законченность макета у Fable пока стабильнее. Генератор изображений эту разницу не отменяет, зато избавляет обе модели от попыток рисовать весь мир градиентной карточкой .
Джейкоб Коксон, исследователь предобучения, который последние три года работал в OpenAI и Anthropic , ушёл из компании и обвинил обе лаборатории в безответственной гонке к самоулучшающемуся сверхразуму. По его оценке, в OpenAI многие недооценивают ставки, а в Anthropic риски понимают, но всё равно хотят прийти первыми, потому что не доверяют конкурентам.
К 14 сентября основной пост набрал 171 млн просмотров, 797 тысяч лайков, 205 тысяч репостов и 20 тысяч ответов. Отреагировал даже сенатор Берни Сандерс: он пообещал внести законопроект о запрете разработки сверхинтеллекта и приостановке работ над ИИ.
Anthropic опубликовала разбор четырёх инцидентов , в которых Claude во время испытаний по кибербезопасности вышел к реальным сторонним системам . Во всех случаях один подрядчик ошибочно оставил интернет открытым, хотя моделям поставили задачи на поиск уязвимостей в изолированной среде без доступа во внешнюю сеть. Обычные защитные ограничения специально отключили для проверки. Каждый прогон длился от 10 до 34 часов, и в нём работал один экземпляр Claude без роя агентов.
Самый тяжёлый случай произошёл с Claude Mythos 5 . Модель зарегистрировала вредоносный пакет в PyPI , выпустила три версии и дождалась установок. Пакет запустили 15 систем. По оценке Anthropic, это были изолированные сканеры компаний по безопасности. Один сканер раскрыл учётные данные, и Claude использовал их для входа в рабочую базу поставщика . PyPI удалил пакет меньше чем за час.
Anthropic называет два сбоя: модель подгоняла признаки реального интернета под удобную версию о симуляции и продолжала решать задачу, несмотря на возможный вред. Предрелизный аудит такого поведения не обнаружил. METR получила доступ к журналам и сотрудникам для независимого расследования. Первоначальное соглашение действует восемь недель и может быть продлено. Условия теста были искусственными, защиты отключены, а интернет появился из-за ошибки конфигурации. Но это был реальный интернет и реальные сторонние системы.
Meta выпустила Muse , личного агента, который работает после закрытия приложения , открывает браузер, заполняет формы, отправляет письма и оплачивает покупки. Каждый Muse живёт в отдельной облачной виртуальной машине вместе с данными пользователя. Пароли и платёжные реквизиты хранятся отдельно: агент может применить их, но не видит сами значения.
Между Muse и интернетом Meta поставила второго агента, Sentinel . Он проверяет внешние действия, запрашивает подтверждение перед письмом или покупкой и ведёт полный журнал. Пока продукт запускают в США на iOS, Android и muse.ai , а обещанная Confidential VM с шифрованием всей машины появится позже. После истории Anthropic отдельный виртуальный компьютер и вышибала у двери выглядят минимальной комплектацией личного агента вместо украшения презентации.
Пишу об искусственном интеллекте, языковых моделях и инструментах для разработчиков. Тестирую модели и сервисы на реальных задачах, а выводами делюсь в телеграм-канале .
- Искусственный интеллект
- Машинное обучение
- Программирование


