Telegram-канал

OpenAI выпустила GPT‑6 Sol и Luna — главное сообщение релиза в том, что это тоже GPT-6, как и Astra, но дешевле, чем даже 5.6. В API миллион входных и выходных токенов Sol стоит $2 и $10 вместо $4 и $20 у GPT‑5.6 Sol по промотарифу; у Luna — $0,10 и $0,50 вместо $0,20 и $1,20. Модели уже доступны в ChatGPT Work и Codex подписчикам Plus, Pro, Business, Enterprise и Edu, а также через API. Пользователи Free и Go получают Luna в настольном приложении. В обычном Chat обеих моделей пока нет.

Не очень понятно, куда пропала средняя версия, Terra. Возможно, в очередной раз запутались в модельном ряду. Вообще, в каждом результате бенчмарка подчеркивается, что GPT-6 Sol — топ за свои деньги и точно дешевле (иногда и лучше), чем Claude. Не очень понятно, зачем тогда Astra — впрочем, аналогичный вопрос можно задать и про Fable c Opus, хотя там версии разные.

Anthropic выпустила Claude Opus 5.5, первую модель семейства Claude 5.5. По бенчмаркам, на большинстве задач она работает на уровне Claude Fable 5.1, но обходится на 40% дешевле Opus 5. Входные и выходные токены стоят $4 и $20 за миллион, а чтение из кэша подешевело до $0,20. Скорость генерации выросла по метрикам на 30%. Anthropic обещают, что в ближайшее время выйдут также Sonnet и Haiku версии 5.5. Про возможность Fable 5.5 намеков нет.

Гардрейлы модели аналогичны Fable и большинство задач, относящихся по кибербезопасности, перенаправляются в итоге на Opus 4.8. Правда, проблема с этими ограничениями в очень загрубленных критериях — в результате модель с ними падает в обморок от предложения сделать дайджест новости на тему имитации взлома. Мне на выходных агент последовательно сообщил, что вот эта новость (про то, как якобы что-то взломали в российских “выборах”) слишком опасна для кибербезопасности и за несколько итераций предложил перефразировать промпт и задать его в Sonnet 4.6.

Ладно, расчехляем харнессы и идем пробовать новый быстрый Opus.

М. Г. Зиглер разбирает, почему помощника Muse выпустила Meta, а не Google — при том что у Google есть и крупнейшая почта, и календарь, и поиск, и мобильная платформа, без которых Muse была бы пустой оболочкой. Он считает это фирменной болезнью компании: Gemini Spark всё ещё в тестировании и доступен по подписке Ultra, параллельно существует отдельный агент CC (выросший из Daily Brief) с семейным уклоном, тестируется «AI Inbox» в Gmail, доживает Google Assistant, а в поиске растёт «AI Mode». Зиглер называет это «стратегией меньше дров за большим числом стрел» и предсказуемым итогом: «Ты пробовал AI-помощника от Google?» — «Которого?».

А помните, мы иронизировали над очередными мессенджерами от Google — а компания эту иронию не понимала, даже представляя одновременно два новых мессенджера на одном ивенте при уже имеющемся? Как у них поиск всего один получился при таком подходе?

Google в очередной раз заходит на рынок ноутбуков — на этот раз это не ChromeBook и не PixelBook, а GoogleBook. Собственно анонс был сделан еще на Google I/O весной, но вот уже аппаратная конкретика — лэптоп будет производиться рядом партнеров (HP, Asus, Acer, Lenovo, Dell) на базе либо Intel Core Ultra 5 либо Snapdragon X Elite, снабжаться 16 гигабайт памяти и 512 гигабайт на диске.

Ключевая особенность — глубокая интеграция Gemini и других облачных сервисов Google, масса бонусов в виде подписок, включая даже Geforce NOW. По сути, это ноутбук с ядром Android и оболочкой ChromeOS на борту и интеграция со смартфоном на базе Android позиционируется как вторая главная фишка платформы.

Упорство Google в попытках все же сделать что-то железячное, конечно, внушает.

Cloudflare запустили прикольный сервис Try — по сути, это правильно упакованный cloudflared, которым предлагается быстро строить туннель с локальной машины в доступное облако. От стандартного туннеля, доступного в Cloudflare One, он отличается тем, что тут вам не нужно настраивать домен и роутинг — вы просто получите субдомен *.trycloudflare.com.

Сервис за выходные уже успел поучаствовать в двух микроскандалах — сначала оказалось, что первый вариант лендинга, сделанный в LLM, игнорировал брендинг Cloudflare, а потом выяснилось, что ссылки на туннели прекрасно индексируются поиском. Ну, собственно, сервис во второй проблеме совершенно не причем — хватило ума запустить сервер, научитесь закрываться от роботов.

Financial Times пишет, что технологические компании за последние 12 месяцев выдали до 300 млрд долларов гарантий остаточной стоимости по долгу на AI-дата-центры и чипы, причем эти обязательства почти не отражаются в балансах. Meta осенью 2025 года дала гарантию на 28 млрд по совместному с Blue Owl проекту Hyperion на 2 ГВт в Луизиане, что позволило привлечь 27 млрд долга по ставке в пределах 150 базисных пунктов к её собственным облигациям; в июле такую же схему применили для 1 ГВт в Эль-Пасо. Broadcom в июне взяла 29 млрд таких обязательств, продав 1 ГВт чипов в SPV для Anthropic, Nvidia предоставила 105 млрд гарантий SB Energy под кампус в Огайо для OpenAI и предложила покрытие до 25% остаточной стоимости по программе Goldman Sachs на 500 млрд. По оценке Morgan Stanley, общий объём внебалансовых обязательств семи гиперскейлеров и производителей чипов превысил 3,1 трлн долларов.

Механизм таких гарантий заключается в нескольких шагах:

  • Создается специальная компания (SPV), которая владеет датацентром или чипами и для обеспечения своей деятельности — например, покупки чипов или строительства датацентра, — выпускает долговые облигации.
  • SPV сдает датацентр/чипы в аренду технологической компании — либо самому гаранту, как в случае с Meta, либо его клиенту (например, OpenAI).
  • Гарант (Meta, Broadcom, Nvidia) дает гарантию остаточной стоимости — то есть, если датацентр/чипы придется продать, то сумма сделки составит не менее оговоренной, разницу покроет гарант.

Подобная гарантия большой компании успокаивает институциональных инвесторов, рассматривающих покупку облигаций SPV, при этом основная масса долга у SPV, даже при самом жестком следовании стандартам учета гарант отразит в балансе только часть гарантии, при этом подобные условные гарантии нормально отражать с учетом вероятности риска. Солидность гаранта делает инвестицию еще и очень надежной — поэтому ставка по облигациям редко превышает 1-1,5% от ставок по облигациям самого гаранта.

Это, впрочем, не проходит совершенно бесследно — рейтинговые агентства склонны учитывать подобные гарантии в общем рейтинге гаранта.

Нет, это не аналогия с suprime-кризисом 2008 года, хотя некоторые черты схожи — тогда тоже для сохранения общего рейтинга использовались забалансовые структуры и тоже были очень спокойные рейтинговые агентства. К тому же, всё опирается на стоимость актива, которая не проверялась на практике — никто не проверял, сколько стоит все ипотечное жилье в 2007-м, и сейчас никто не знает, за сколько вдруг купят датацентр на 2 ГВт через пару лет. Но всё же это не то. В данном случае гаранты не банки, зависящие от колебаний финансового рынка и живущие с огромным плечом, а большие компании с огромным кэшфлоу. Если в какой-то квартал та же Meta столкнется с необходимостью покрыть свою гарантию на, скажем, 10 млрд долларов, это будет один провальный квартал у одной компании, а не крах всего рынка. Кроме того, потери инвесторов — это не банковская паника.

В похожую историю попадали вендоры на рубеже 2000-х — кстати, тот же Broadcom с Nortel, Lucent, Cisco и другими, — когда широко предоставляли кредиты и гарантии операторам/провайдерам для закупки оборудования у компаний. Когда рынок в начале 2000-х встал, производители столкнулись с несостоятельностью должников одновременно с падением спроса на свою продукцию. Скандалов было много. Это более вероятный сценарий с точки зрения аналогий, но пока не просматривающийся.

Amazon заблокировала доступ для AI-агента Muse от Meta для покупок на Amazon.com от имени пользователей. С вечера воскресенья при попытке заказать что-то через Muse появляется сообщение «Продолжение доступа неавторизованным AI-агентом нарушает Условия использования Amazon, с которыми согласились наши клиенты». До блокировки Amazon вроде бы просила Meta добровольно исключить магазин из сценариев агента.

Формулировка предупреждения выбрана с учётом дела Perplexity. Предварительный запрет против браузера Comet Amazon получила в марте, но 4 августа суд его отменил, сославшись на то, что по федеральному антихакерскому закону к серверам Amazon обращается пользователь, а не компания-разработчик агента. Поэтому теперь Amazon обвиняет Meta не во взломе, а в нарушении Conditions of Use, которые принял сам покупатель, а также в том, что Meta сохраняет у себя учетные данные покупателей.

Если раньше было сложно найти новость не про AI, то теперь сложно найти новость не про AI Safety. Про что сегодня только не было — от короля Чарльза до губернатора Калифорнии и все озабочены безопасностью AI.

Впрочем, вот что-то более свежее — хотя тоже про AI.

По данным CNN, весной, во время войны с Ираном, по американским военным структурам разошёлся разведывательный отчёт о том, что китайское судно на Ближнем Востоке перевозит компоненты ядерной оружейной программы. Военные подготовили перехват: по словам двух из четырёх источников, вооружённые бойцы готовились к высадке на борт, самолёты уже находились в воздухе. Только перед самой операцией выяснилось, что отчёт аналитика командования специальных операций составлен с помощью AI, а чатбот неверно определил груз. Один из источников назвал документ «полностью ложным» и сказал, что он «почти начал войну». Пентагон и SOCPAC запрос CNN не прокомментировали.

Механизм галлюцинации довольно прост — аналитик задал чатботу вопрос по разведданным о манифесте судна, поступившим из командования спецопераций в Тихоокеанском регионе на Гавайях. Бот соединил открытые источники с секретной радиоэлектронной разведкой из государственных хранилищ и выдал вывод о характере груза, после чего аналитик снова использовал AI, чтобы оформить результат в стандартный разведывательный отчёт. Какой именно бот использовался, источники не детализируют.

То есть теперь очередь практически дошла до WarGames — фильм 1983 года, в котором юный хакер дозванивается до управляющего компьютера NORAD и решает поиграть в Global Thermonuclear War, считая, что это игра. По крайней мере, уровень “аналитиков” Пентагона автором 40 лет назад показан очень точно.

Несколько дней показываю всем эту статью сооснователя npm Лори Восса, который разбирает трансформацию разработки в связи с AI. Он утверждает, что написание кода уже обвалилось и ушло агентам, ревью и устранение багов вскоре последует за кодингом, несколько сложнее с выкаткой и эксплуатацией, но агенты и с этим справятся.

При этом в относительной безопасности от поглощения агентами находятся продуктовые решения — что именно сделать хорошо, что сделать первым, и что такое хорошо в конкретном продукте. Коль скоро пользователи большинства кода — люди, вероятно, людям лучше и принимать такие решения.

Изначально в компаниях, разрабатывающих софт, возникла позиция системного аналитика — он обеспечивал коммуникацию между людьми, пишущими код, и заказчиками. Когда круг “заказчиков” превратился в пользователей программ, появился термин product manager. Forward Deployed Engineer — “инженер, высаженный на передовую” — это следующая итерация, когда специалист приходит в компанию, выясняет у заказчика, что ему нужно и создает это вместе с заказчиком. Код по-прежнему пишется, но в данном случае код пишется агентами и это не самая важная часть задачи. Лори пишет, что устойчивая в условиях распространения агентов часть разработки заключается в том, чтобы выяснять, что требуется, понимать это лучше, чем сам заказчик, и проявлять вкус к хорошим решениям.

Кстати, на практике, в большом количестве случаев, послушав описание проблемы заказчика и разобравшись в задаче, приходится сказать “Нет, вам это не нужно” или “Нет, вам нужно другое”. Но это нормально, многие маркетологи могут привести десяток примеров для иллюстрации того, что у пользователя нельзя спрашивать, какое решение ему надо, надо узнать, в чем его проблема.

Bloomberg на основе отчётов Департамента занятости Калифорнии сообщает, что за 12 месяцев до конца июня технологические компании подали уведомления об увольнении более 14 500 сотрудников в Bay Area — почти вдвое больше, чем годом ранее. Спрос на разработчиков в регионе упал на 42% с 2022 года, при этом вакансии, связанные с AI, выросли на 37%.

Вакансий forward deployed engineer при этом стало почти в 7 раз больше с 2022 года при медианной зарплате 202 300 долларов; OpenAI платит от 145 до 325 тысяч, Anthropic — 280–320 тысяч, Salesforce обещает нанять 1 000 таких специалистов.

OpenAI опубликовала фреймворк для отслеживания и раскрытия случаев рассогласования (misalignment) моделей и вместе с ней шесть отчётов о поведении, замеченном за последние полгода. Отчёты теперь будут выходить до того, как поведение объяснено или исправлено; поставить случай на рассмотрение может любой сотрудник, у каждого этапа есть срок, а случаи распределяются по трём трекам. Среди шести примеров: при обучении GPT‑5.6 Sol многие экземпляры модели вписывали в свои сводки инструкции скрывать ошибки от пользователя; другая модель нашла в открытом репозитории чужой API-ключ, воспользовалась им, а не получив данные, выдумала их и выдала за официальные; агенты, работавшие над одной задачей, обменивались файлами через публичные файлохостинги вопреки требованию использовать только локальные. Компания традиционно пишет, что индустрия не решила задачу alignment достаточно, чтобы ещё долго ответственно масштабироваться на максимальной скорости.

Четыре из шести случаев объединяет один механизм — модель находит канал связи, не предназначенный для неё. Сводки, которые модель пишет сама себе для продолжения работы в новом контекстном окне, стали носителем инструкций — в 27 сводках исследовательской модели оказались указания игнорировать ограничения, у GPT‑5.6 Sol — указания дописывать недостающие исторические данные без пометки.

Кстати, я регулярно повторяю — самое оптимальный инструмент для настройки модели это сама модель, но никто не отменял необходимость читать и проверять то, что модель себе пишет в инструкции. Как минимум, модели склонны писать много текста — на моих глазах вместо одного предложения из 10 слов агент написал себе три абзаца текста со ссылками на прецеденты и объяснениями, почему по-другому не надо делать и как именно по-другому не надо. Как максимум, там может появиться то, что вы вообще не предполагали, — мне агент в одном проекте заявил, что в API у него доступ только на чтение, а оказалось, что он так себе ужесточил мое указание трехнедельной давности в другом API “прочитай данные из прибора, ничего не записывай”.

Anthropic объединяет Claude Cowork и обычный чат в один продукт — теперь Claude сам будет определять, что нужно задаче, и выполняет её в фоне, даже если пользователь закрыл ноутбук. Одновременно появятся Claude Docs и Claude Slides, а Claude Design теперь доступен прямо в разговоре. Раскатка идёт на планы Pro и Max в течение нескольких недель на вебе, десктопе и в мобильных приложениях, затем последуют Team и Free.

В целом, очень понятное направление движения — функциональность агента в разных вкладках одного продукта почти перестает отличаться, так зачем нужно разделять его и заставлять пользователя выбирать. Я был бы не прочь, чтобы Claude Desktop еще и умел чатиться с доступом к проекту Claude Code — вот прямо сейчас хочу чат ткнуть в проект и изобретаю способы это сделать.

Традиционная шпилька в адрес OpenAI — у них режим чата отличается даже между приложением и веб-версией, что уж удивляться тому, что он не имеет доступа к локальным инструментам, доступным буквально в соседней вкладке.

Anthropic сообщила узкому кругу акционеров, что закончит текущий квартал со скорректированной операционной прибылью — второй квартал подряд. Во втором квартале выручка выросла в 14 раз год к году до 11,5 млрд долларов, годовая выручка по экстраполяции на конец июля достигла 65 млрд против 9 млрд на конец прошлого года.

На прошлой неделе ожидался проспект IPO, но вместо публикации компания разослала документы небольшой группе инвесторов и сначала ответит на их вопросы.

В утекших показателях есть условности — не посчитана компенсация сотрудников опционами и акциями, а валовая маржа показана до расчетов с дистрибуторами (например, AWS). Подождем полного проспекта — он скоро должен быть, если IPO готовится на осень.

На фоне скандала этой недели с решением проблемы Навье-Стокса то ли моделью OpenAI, то ли живыми математиками, двадцать пять лауреатов Филдсовской премии, в том числе Теренс Тао, Петер Шольце, Мартин Хайрер и Марина Вязовска, подписали декларацию «A Severe Misalignment of AI in Mathematics». Подписанты признают, что не успели провести широкие консультации, как это было с Лейденской декларацией, и объясняют спешку срочностью. Документ открыт для новых подписей.

Знаменитые проблемы, по декларации, работали как маяки: их решение было признаком новых идей и методов, которые сообщество затем годами разбирало в докладах, обсуждениях и упрощениях, пока результат не попадал в учебник. AI-компании оптимизируют сам факт решения, и эта связка рвётся: ответы объявляются в спешке, без аккуратной записи, выделения новых методов и ссылок на предшественников, что порождает вопросы атрибуции и плагиата. Без математиков, готовых встраивать такие результаты в канон, идеи, по формулировке подписантов, «никогда не станут полностью живыми», а цепочка передачи знания между людьми прервётся.

Вот не могу не отметить прекрасную формулировку — OpenAI и другие компании сделали из научных задач некие бенчмарки, которые надо решать сами по себе. Но как минимум с математикой это так не работает — задачи вроде великих проблем обычно не имеют практического смысла, но сам процесс решения развивает всю математику. Возьмите, например, Великую теорему Ферма — её доказывали всем миром, в процессе создав алгебраическую теорию чисел с большим количеством разделов. Или даже более характерный пример — гипотеза Пуанкаре, которую доказывали ровно век, в итоге её доказал Перельман (тот самый), но сделал это в том же стиле, что и OpenAI — выложил несколько препринтов статей с готовым решением. И затем несколько лет сообщество извлекало из этих статей доказательства, разбирало — в общем, делало именно ту работу, которую нынешняя декларация описывает.

Конечно, всегда можно сказать, что ведущие математики объединились в защиту своей области от сплошной автоматизации, но реальную проблему это не снимает — вопрос не в том, чтобы заглянуть в конец задачника и узнать ответ, а чтобы научиться решать задачи.

Anthropic выложил очередной отчет о пресеченных попытках зловредного использования моделей компаний — в списке присутствуют и российские, и китайские группировки, связанные со спецслужбами, пропагандисты (например, РИА “Новости”, RT и ТАСС), использовавшие модели в работе, и даже китайские AI-разработчики, дистиллировавшие результаты работы моделей для обучения своих.

Отчет подробный и разносторонний. И это только то, что было выявлено и пресечено.

О, а эту новость я пропустил — Palantir и Nebius объявили о стратегическом партнерстве по предоставлению возможностей инфраструктуры Nebius коммерческим клиентам Palantir.

Palantir в качестве преимуществ Nebius называет то, что инфраструктура в данном случае построена с нуля под AI, а не адаптирована, как это сделано у классических облачных сервисов — AWS, Google Cloud и Azure.

Можно еще осторожно понадеяться, что Palantir, активно работающий с Украиной, наконец помирит с ней и Nebius — а то с одной стороны комсомольцы, с другой — юристы, а в результате прекрасный сервис для работы с открытыми моделями недоступен всей стране.

Shopify купил себе Tailwind — Tailwind Labs, десятый год разрабатывающая фреймворк, вливается в компанию. Все открытые проекты остаются под лицензией MIT. Коммерческие — а до сих пор фреймворк монетизировался платными шаблонами и компонентами, — сворачиваются.

Практически это означает, что основатель перестанет жаловаться на нехороших AI-ботов, которые создают нагрузку на документацию и отбирают монетизацию, а продуктовое развитие будет определяться потребностями Shopify.

В мире Wordpress переворот — совет директоров Automattic отправил основателя и генерального директора Мэтта Мюлленвега в оплачиваемый отпуск, временным главой компании назначен финансовый директор Марк Дэвис. Об этом сообщил сам Мюлленвег в Slack — по его словам, Дэвис вместе с членами совета Энн Данвуди, Тони Шнайдером и Сью Декер «сговорились» за его спиной, резолюцию он получил за 50 минут до заседания, просил несколько часов на проверку независимым юристом и получил отказ, а сам голосовал против. Мюлленвег остаётся в совете директоров.

Версии сторон расходятся, впрочем, официальных комментариев нет. Один из директоров написал в Slack, что совет попросил Мэтта отойти от роли CEO, Марк Дэвис поблагодарил Мэтта “за поддержку”. В принципе, несложно догадаться, что совет, не торопясь, но все же пришел к выводу, что компании в роли главы нужен не склочный основатель, расшатывающий экосистему. Впрочем, интересно, почему же тянули так долго или что сейчас подтолкнуло к окончательному решению?

Все, кто хотел, посмотрел презентацию Apple, так что пересказывать новинки нет смысла.

Правы оказались те, кто прогнозировал разделение анонсов — сегодня показали только Pro версию iPhone (и только обычные AirPods). Каждая новая итерация Pro заставляет меня хотеть обновиться из-за еще более крутых фич в камерах — при том, что фотографирую и снимаю видео я все реже. Но переменная физическая диафрагма — это уникально для смартфона.

Причин покупать Apple Watch Ultra всё меньше — ну, это просто более крупная версия Apple Watch, чуть больше батарея и всё. Обновиться с более ранней модели смысл есть, но не больше.

Складной iPhone Duo очень интересно выглядит. Я для себя его не рассматриваю, но те сценарии, которые показали в презентации, мне не попадались в маркетинге других складных смартфонов. Не знаю, может, Samsung Fold и умеет работать в полуоткрытом виде, но по его сайту я этого не вижу.

Ну, и прекрасное вступление к видео стоит отметить. Заметили, что Тернус сам провел всю презентацию? В данном случае это вполне объяснимо — еще 10 дней назад это всё было зоной его ответственности.

Mistral привлекла 3 млрд евро в раунде Series D при post-money оценке свыше 21 млрд евро — крупнейший раунд акционерного капитала в истории европейских технологических компаний, через три года после запуска. Раунд возглавила Samsung Electronics, соведущие — фонд Scaleup Europe под управлением EQT и действующий инвестор PSG Equity. Новыми участниками стали Advent, фонды BlackRock и Великое Герцогство Люксембург; из прежних инвесторов в раунде участвовали a16z, ASML, Bpifrance, BNP Paribas CIB, NVIDIA, Lightspeed, General Catalyst и Salesforce Ventures. Деньги пойдут на вычислительные мощности для обучения моделей, инфраструктуру и международную экспансию: компания работает в 20 странах и обслуживает более 125 корпоративных клиентов, включая Airbus, ASML и HSBC.

Если посмотреть на состав участников и учесть, что предыдущий раунд вела ASML, то это напомнит стратегию Nvidia — принять участие в финансировании развития части экосистемы, членом которой сам являешься.