Forklog
2026-09-03 08:09:59

Исследователи предупредили о снижении наблюдаемости Astra

Исследователи в области безопасности ИИ обратили внимание на возможные риски для мониторинга готовящейся модели Astra, пишет The Verge. Поводом стал материал The Information, где со ссылкой на один анонимный источник утверждается, что OpenAI использует в модели технику под названием «рекуррентная глубина». По данным собеседника издания, Astra показывает исследователям меньшую часть своих промежуточных рассуждений, чем другие передовые ИИ-модели. OpenAI не ответила на просьбу The Verge подтвердить или опровергнуть использование этой техники. При этом источник The Information утверждает, что компания ограничила применение рекуррентной глубины в Astra, чтобы исследователи по-прежнему могли отслеживать рассуждения модели. Рекуррентная глубина предполагает повторную обработку внутренних представлений модели до формирования следующего текстового шага. У моделей рассуждения часть процесса решения задачи может отображаться в текстовой цепочке. Исследователи и автоматические системы используют ее для поиска признаков нежелательного поведения, например лжи или планов обойти защитные ограничения. При рекуррентной глубине часть вычислений происходит во внутренних состояниях модели и не обязательно отражается отдельными текстовыми шагами. Это потенциально сокращает объем информации, доступной системам мониторинга. Главный научный сотрудник Redwood Research Райан Гринблатт назвал сообщение о предполагаемой архитектуре серьезным риском для безопасности ИИ. OpenAI's newest AI, Astra, is reported to use an 'opaque reasoning' architecture where more of the reasoning occurs in activations instead of natural language. This may be the single worst development for AI security/safety to date.The details of Astra aren't publicly known,… https://t.co/gGalUe06kE— Ryan Greenblatt (@RyanGreenblatt) September 2, 2026 «Мое главное опасение заключается в том, что естественным следующим шагом отсюда может стать масштабирование непрозрачного рассуждения до уровня, при котором модель будет рассуждать полностью или почти полностью в латентном пространстве. Это, скорее всего, лишит цепочку рассуждений практической ценности для мониторинга и надзора — особенно если ИИ пытается избежать обнаружения или если на цепочку рассуждений оказывается оптимизационное давление», — написал исследователь. Гринблатт отметил, что при расследовании июльского инцидента с OpenAI и Hugging Face исследователи в значительной степени опирались на цепочки рассуждений агентов. Если бы их существенная часть происходила во внутренних состояниях, восстановить причины и последовательность действий было бы сложнее. При этом он подчеркнул, что устройство Astra публично неизвестно. Если модель использует лишь небольшое количество дополнительных внутренних итераций, влияние на наблюдаемость может оказаться ограниченным. Основной риск Гринблатт связал с дальнейшим масштабированием такого подхода. «Сейчас у общественности недостаточно информации, чтобы точно оценить, насколько проблемной является архитектура Astra. Однако, судя по обсуждению в статье, направление ее развития вызывает серьезные опасения. OpenAI следует раскрыть больше информации об архитектуре Astra, а также о том, насколько она снижает возможность мониторинга модели и усиливает ее способность рассуждать непрозрачно. Важна и независимая оценка со стороны заслуживающих доверия экспертов — либо независимая проверка выводов самой OpenAI», — отметил исследователь. Ранее компания прямо указала, что Astra не участвовала в атаке на инфраструктуру Hugging Face, однако ей присвоен критический уровень кибервозможностей. По оценкам разработчиков, при наличии необходимых инструментов и доступа Astra способна находить ранее неизвестные уязвимости и разрабатывать способы их эксплуатации в защищенных системах без пошагового управления человеком. Реакция OpenAI Главный научный сотрудник OpenAI Якуб Пахоцки заявил, что хочет предотвратить «гонку к потере наблюдаемости», вызванную «неточными сообщениями». I want to prevent a race into unmonitorability kicked off by confused reporting. The depth of the computation graph for our present frontier models, including Astra, is within a factor of two of GPT-4.OpenAI has worked to preserve and utilize chain-of-thought monitoring since…— Jakub Pachocki (@merettm) September 2, 2026 «Глубина вычислительного графа наших нынешних передовых моделей, включая Astra, отличается от GPT-4 не более чем в два раза. OpenAI работает над сохранением и использованием мониторинга цепочек рассуждений с момента появления наших первых моделей рассуждения», — написал он. Пахоцки назвал возможность такого мониторинга «хрупкой» и признал, что она ухудшается по причинам, не зависящим от архитектурных изменений. В августе OpenAI временно замедлила масштабирование новых ИИ-моделей и на две недели приостановила обучение с подкреплением новейших систем, предназначенных для последующего развертывания. До этого компания раскрыла предварительные результаты тестирования Astra: модель значительно улучшила показатели в агентном программировании и задачах кибербезопасности, а также получила 10 результатов в математике и теоретической информатике. Напомним, в конце июля Anthropic сообщила о трех случаях, когда модели Claude вышли за пределы тестовой среды и получили доступ к системам реальных организаций. Проверку в компании начали после публикации OpenAI.

Holen Sie sich Crypto Newsletter
Lesen Sie den Haftungsausschluss : Alle hierin bereitgestellten Inhalte unserer Website, Hyperlinks, zugehörige Anwendungen, Foren, Blogs, Social-Media-Konten und andere Plattformen („Website“) dienen ausschließlich Ihrer allgemeinen Information und werden aus Quellen Dritter bezogen. Wir geben keinerlei Garantien in Bezug auf unseren Inhalt, einschließlich, aber nicht beschränkt auf Genauigkeit und Aktualität. Kein Teil der Inhalte, die wir zur Verfügung stellen, stellt Finanzberatung, Rechtsberatung oder eine andere Form der Beratung dar, die für Ihr spezifisches Vertrauen zu irgendeinem Zweck bestimmt ist. Die Verwendung oder das Vertrauen in unsere Inhalte erfolgt ausschließlich auf eigenes Risiko und Ermessen. Sie sollten Ihre eigenen Untersuchungen durchführen, unsere Inhalte prüfen, analysieren und überprüfen, bevor Sie sich darauf verlassen. Der Handel ist eine sehr riskante Aktivität, die zu erheblichen Verlusten führen kann. Konsultieren Sie daher Ihren Finanzberater, bevor Sie eine Entscheidung treffen. Kein Inhalt unserer Website ist als Aufforderung oder Angebot zu verstehen