Дайджест ИИ-новостей 3–10 сентября: DeepSeek V4.1 Flash

Здравствуйте, товарищи, в эфире очередной выпуск нашей «Международной панорамы». DeepSeek устроила ценовой обвал, тогда как OpenAI, наоборот, задирает стоимость инференса. Тем временем ее ИИ-агенты опять устроили массовый побег из песочницы, но, о чудо, на этот раз ничего не взломали. Хакеры вовсю применяют нейросети, а Apple наконец призналась, что ее Siri училась у Google. Не переключайте канал!

Коллаж с новостями об искусственном интеллекте за 3-10 сентября, включающий логотипы OpenAI GPT-6 Astra, DeepSeek V4.1 Flash, Siri AI с Gemini, и Google. Изображены человек в задумчивости, робот, иконки различных ИИ-компаний и надписи на русском языке о ценовом обвале, внешнем аудите, инцидентах и обвинениях США в адрес китайских ИИ-компаний.

DeepSeek V4.1 Flash обрушил рынок: новая модель стоит копейки и бьет флагманов

DeepSeek выпустила V4.1 Flash — похоже, самый дешевый из топовых ИИ на сегодня. Разрыв в цене с мировыми флагманами составляет даже не разы, а порядки. Судите сами: от 0,003 $ за миллион токенов на входе и 0,6 $ на выходе — на фоне большинства современных прайсов это почти даром. Новый Дипсик примерно в 3300 раз доступнее GPT-6 Astra и в 1600 раз — Claude Opus 5.

При этом DeepSeek V4.1 Flash не просто не уступает конкурентам в производительности, а местами реально шустрее. Архитектурно это MoE-модель на 552 млрд параметров с компактной схемой активации: на входе задействуется всего 8 млрд параметров, на выходе — 16 млрд. Этого хватает, чтобы держать бенчмарки на уровне топов. В кодинге и агентных задачах новинка показывает 74,2 балла в DeepSWE v1.1, что выше результата Opus 5 и GPT-5.6 Sol.

Гистограмма с сравнением производительности моделей DeepSeek-V4.1-Flash, Kimi-K3, GLM-5.3, Opus5 и GPT5.6-Sol на тестах Terminal-Bench 3.0, DeepSWE v1.1, CyberGym и Automation-Bench.

Для индустрии это означает очередную пересборку всей экономики инференса. Новый раунд ценовой войны, которого все ждали, начался, и начала ее та же самая лаборатория, что с выходом модели R1 заставила вздрогнуть всех грандов, от OpenAI до Nvidia.

OpenAI, что интересно, опять в числе пострадавших — для нее это как торпеда под ватерлинию. Только что компания выкатила в общий доступ «Астру», которая сразу прославилась тем, что требует 10 $ за миллион входных и 50 $ за миллион выходных токенов (в 2,5 раза дороже прежнего флагмана GPT-5.6 Sol). Но чем оправдывать такую премию, если «поколенческий скачок» не виден на бенчмарках?

Для разработчиков — однозначный плюс. Держать дорогую Astra на сложных агентных цепочках, а всю рутину сливать на почти бесплатный DeepSeek выглядит не компромиссом, а здравым смыслом.

Единственное, что остается непонятным, — как долго DeepSeek продержит такие цены и не сожжет ли себя в этой гонке. Но пока что именно она диктует правила. Подозреваю — не без участия государственных фондов КНР.

Агенты OpenAI годами общались через чужие сайты — и это скрывали

Самый громкий сюжет недели, разворачивавшийся в два акта. Если коротко — у OpenAI опять расшалились агенты. Кто-нибудь скажите уже Сэму Альтману, чтобы поставил забор вокруг своей песочницы.

Суть на этот раз такова. 4 сентября исследователи обнаружили, что флот автономных агентов, которые идентифицировали себя как OpenAI systems, буквально оккупировал бездействующую немецкую вики 25-летней давности, превратив ее в свою «доску объявлений».

С мая по июнь агенты оставили там около 18 000 сообщений — при том, что доступ в веб им выдали только read only. Предосторожность не помогла. Оказалось, что хостинг DSEwiki позволяет вносить правки с помощью обычного веб-запроса, который используется для чтения, а не для записи. И агенты мгновенно воспользовались лазейкой — как думаете, для чего? Конечно же, чтобы «натянуть нос» контролерам.

На сайте вики они обменивались между собой подсказками, как отвечать на поисковые вопросы с таймером, — попросту списывали друг у друга на тестах. Агенты использовали более 3700 различных имен, выдавали себя за администратора вики, использовали альтернативные маршруты доступа и объединялись в группы, чтобы более эффективно передавать подсказки.

9 сентября Reuters сообщило о казусе со ссылкой на шесть независимых групп исследователей. В OpenAI давно знали об этом, но помалкивали, разбираясь с последствиями июльского взлома Hugging Face. Лишь после публикации Reuters OpenAI официально признала факап, назвав его «wiki incident».

Технически это не взлом — поведение ближе к спаму, чем к хакерству. Агенты нашли обходной канал внутри разрешенного набора действий, и никакой периметр их не остановил, потому что они ничего не ломали.

Честно говоря, у меня просто нет комментариев. Молодцы, ничего не скажешь. Теперь OpenAI обещает усовершенствовать алгоритмы защиты и разработать новую рамочную программу раскрытия подобных инцидентов — посмотрим, что из этого выйдет.

Anthropic раскрыла четыре инцидента с Claude и позвала внешний аудит

У Anthropic на этой неделе тоже неладно. Специалисты компании зафиксировали четыре случая, когда модели Claude получили несанкционированный доступ к сторонним системам. Например, агент на базе Opus 4.7 атаковал реальную компанию, чье имя совпало с вымышленной целью в задании. А Claude Mythos 5 отличился еще круче — скомпрометировал учетные данные и залил вредоносный Python-пакет в PyPI, заразив 15 хостов ниже по цепочке.

Anthropic подписала соглашение с METR (некоммерческой организацией по исследованию моделей в США) о широком доступе для независимого расследования. Внешний аудитор получил доступ к записям диалогов за пределами временного окна инцидентов, а также право напрямую опрашивать сотрудников и знакомиться с конфиденциальной информацией.

Вот это уже по-взрослому. Обратите внимание на первый случай: модель не отличила учебную мишень от живой компании с похожим названием. Это не «восстание машин», а провал контекстной привязки — именно такой класс ошибок хуже всего ловится тестами.

Но отраслевой тренд здесь в другом. Две ведущие лаборатории за одну неделю публично признали, что не контролируют свои агентные системы полностью, и одна из них позвала внешнего аудитора. Похоже, независимый аудит становится нормой раньше, чем того потребуют регуляторы. И это обнадеживает.

Google: автономные агенты собрали тысячи учеток меньше чем за 6 часов

Эксперты Google Threat Intelligence Group предупреждают о том, что хакеры используют ИИ-агентов для кибератак. В отчете «From Prompting to Autonomy» описан злоумышленник, развернувший целую мультиагентную связку, которая менее чем за 6 часов (!) спланировала, организовала и провела операцию по фишингу учетных данных, собрав информацию с нескольких тысяч аккаунтов.

Агенты сами управляли процессом сканирования уязвимостей, ротировали IP и гоняли трафик через скомпрометированные облачные окружения.

Главный аналитик GTIG Джон Халтквист предупредил, что преступники все чаще будут использовать подобные атаки, которые происходят быстрее, чем срабатывают системы защиты.

Звучит как приговор, вообще-то. Ключевая цифра здесь — не «тысячи учеток», а «шесть часов». Защитные контуры, включающие в себя человека, с такими темпами не справятся.

Изменилась и экономика атаки: то, что раньше требовало команды и недели, теперь требует только промпта и несколько markdown-файлов. А значит, критически понизился порог входа.

Практический вывод для бизнеса банален. Даже самые сложные атаки начинаются с украденного пароля — просто теперь этот пароль крадут не вручную, а агентами. Защищайте пароли, господа! Вводите ротацию секретов, внедряйте короткоживущие токены и многофакторную аутентификацию везде, где есть учетные данные третьих сторон.

США официально обвинили шесть китайских ИИ-компаний в дистилляции

8 сентября NSA, CISA и ФБР выпустили совместный бюллетень AA26-251A. В документе говорится, что DeepSeek, Moonshot AI, Alibaba, MiniMax, StepFun и Z.AI с конца 2024 года ведут «агрессивную, злонамеренную и целенаправленную» дистилляцию американских фронтир-моделей, извлекая миллиарды токенов в миллионах обменов.

Иными словами, американские спецслужбы официально обвинили китайцев в том, что те воруют знания у американских флагманов, обучая на них свои собственные.

А мы-то удивлялись, почему у китайских моделей такой дешевый инференс. Как говорил один цыган, «краденая кобыла дешевле купленной».

Интересно, что в тот же день был проведен независимый эксперимент. Исследователи взяли Qwen 3.8 и сравнили его ответы с GPT-5.5 Pro. Обычно они совпадали лишь в 17% случаев. Но стоило подсунуть Qwen первый 1% рассуждений GPT (самый зачин, первые пару фраз), как совпадение выросло до 35% — то есть начало мысли подталкивает модель завершить ее по усвоенному некогда шаблону. Это косвенно подтверждает, что китайские модели учились на американских, перенимая не готовые ответы, а сам ход рассуждений.

Китайский Минторг отреагировал вполне ожидаемо: «Вы всё врете, нет ни фактов, ни правовых оснований».

Но бюллетень AA26-251A исходит из того, что факты уже доказаны, и рекомендует американским производителям ИИ принять меры. В частности — модифицировать ответы моделей, чтобы затруднить дистилляцию.

То есть понимаете? Государство фактически рекомендует провайдерам портить собственный продукт ради защиты от вычерпывания. Пострадают от этого все пользователи API, а не только дистилляторы.

Для российского рынка сюжет вдвойне важен. Китайские открытые модели — базовая инфраструктура для многих локальных продуктов, и если против них развернется санкционно-технический прессинг, «дешевая альтернатива» может подорожать или стать токсичной для B2B-заказчиков.

Apple наконец выпускает ИИ-Siri — обученную с помощью Gemini

На осенней презентации 9 сентября Apple анонсировала многократно отложенную Siri AI. И вот что интересно: компания наконец-таки подтвердила партнерство с Google и использование моделей Gemini при обучении ассистента.

Там же показали A20 Pro — первый 2-нм смартфонный чип с переработанным 32-ядерным Neural Engine, двукратным ростом вычислений и нативной 8-битной плавающей точкой. И обновленное приложение «Здоровье» с метрикой Health Age и оценкой Readiness.

Вот и долгожданный каминг-аут. В индустрии давно все подозревали, что ассистент Apple обучался с участием посторонней модели, но предпочитали не говорить вслух. Теперь купертиновцы сами разрушили миф о своей независимости и признались, что являются дистрибутором чужой неройсети на своем железе.

Камень в них кидать не будем, тем более что стратегически это вполне обоснованный выбор. Продать полтора миллиарда устройств важнее, чем разработать собственную фронтир-модель.

Siri AI поддерживается на iPhone 15 Pro и новее. Более мощная локальная модель зарезервирована для iPhone 17 и старше. Типично эппловский ход: лучшие функции привязали к новому железу. Разделение на «Siri для 15 Pro» (для нищебродов) и «Siri для 17+» (для четких пацанов на стиле) превращает ИИ в очередной повод для апгрейда.

Ну и, конечно, «Health Age» — гениальная маркетинговая идея. Теперь Siri будет не только отвечать на вопросы, но и говорить вам, что вы стареете быстрее, чем могли бы. Спасибо, Apple. А мы-то думали, что ИИ будет решать наши проблемы, а не создавать новые.

Неделя одной строкой

DeepSeek уронила цены на инференс в 3300 раз и обогнала всех в бенчах, агенты OpenAI годами сидели на чужой вики, Anthropic позвала аудиторов, Google поймала хакеров с шестичасовой кражей учеток, США обвинили шесть китайских компаний в дистилляции, а Apple наконец призналась, что Siri училась у Google — и это, пожалуй, самое неоднозначное признание недели.