BTC $86,630.60 +3.75%
ETH $2,749.81 +2.45%
BNB $780.26 +1.79%
XRP $1.54 +3.94%
SOL $122.32 +4.48%
TRX $0.3348 +0.59%
DOGE $0.0969 +2.98%
ADA $0.2561 +4.45%
BCH $315.50 +2.94%
LINK $14.34 +0.41%
HYPE $90.90 +2.41%
AAVE $182.94 +12.36%
SUI $1.20 +4.48%
XLM $0.2254 +2.60%
ZEC $1,385.27 -0.22%
AAPL $332.54 +0.72%
AMZN $253.41 +1.04%
GOOGL $343.81 -1.49%
MSFT $521.72 +0.68%
META $735.73 +0.82%
NVDA $235.87 +2.55%
TSLA $368.13 +2.97%
SNDK $1,729.83 -1.38%
INTC $123.79 +4.26%
SPCX $151.38 -0.20%
MU $1,089.28 +2.20%
AMD $635.22 +4.09%
BTC $86,630.60 +3.75%
ETH $2,749.81 +2.45%
BNB $780.26 +1.79%
XRP $1.54 +3.94%
SOL $122.32 +4.48%
TRX $0.3348 +0.59%
DOGE $0.0969 +2.98%
ADA $0.2561 +4.45%
BCH $315.50 +2.94%
LINK $14.34 +0.41%
HYPE $90.90 +2.41%
AAVE $182.94 +12.36%
SUI $1.20 +4.48%
XLM $0.2254 +2.60%
ZEC $1,385.27 -0.22%
AAPL $332.54 +0.72%
AMZN $253.41 +1.04%
GOOGL $343.81 -1.49%
MSFT $521.72 +0.68%
META $735.73 +0.82%
NVDA $235.87 +2.55%
TSLA $368.13 +2.97%
SNDK $1,729.83 -1.38%
INTC $123.79 +4.26%
SPCX $151.38 -0.20%
MU $1,089.28 +2.20%
AMD $635.22 +4.09%
first_img

OpenAI: Перед передовым обучением с подкреплением необходимо представить обоснование безопасности

2026-09-29 15:00:27

OpenAI опубликовала статью по безопасности 28 сентября 2026 года, в которой утверждается, что перед продолжением любых передовых тренировок с подкреплением необходимо предоставить структурированные документы по безопасности. В идеале такие документы должны соответствовать уровню структурированных рисковых обоснований на основе доказательств, используемым в критически важных отраслях, таких как авиация и ядерная энергетика. OpenAI рассматривает это как направление своих усилий, одновременно признавая, что из-за сложности, возникающей из возможностей ИИ, достичь такого же уровня строгости сложно.

Статья сосредоточена на передовых тренировках с подкреплением и не охватывает более широкие атрибуты согласования, необходимые для внутренних и внешних развертываний. В статье предлагаются текущие практики, которые, как ожидается, будут продолжать развиваться и уже внедряются внутри OpenAI. Технические меры защиты должны охватывать согласование моделей, изоляцию и мониторинг, включая предотвращение спекуляций на положительных подкреплениях, оценку согласования в оффлайне и стресс-тестирование, недопущение автоматических оценщиков к цепочкам размышлений, а также безопасность многоуровневой инфраструктуры, красные команды в песочнице, ограничение высокоскоростной межвыборочной связи и неизменяемое сохранение записей агентов.

Операционные принципы включают предварительные разногласия между командами, возможность вето со стороны старшего руководства, ответственность руководителя тренировки за обоснование безопасности и реагирование на инциденты, а также приостановку в случае сбоя, внутренний контроль, аудит доступа и эскалацию по степени серьезности. В отношении серьезных инцидентов OpenAI предлагает контролируемый доступ к оригинальным записям, анализ коренных причин, обзор операций и культуры, а также оценку, вытекающую из инцидента, как регрессионное тестирование; после завершения расследования результаты, обзор и изменения в операциях должны быть опубликованы, а затронутые третьи стороны должны быть уведомлены как можно скорее.

app_icon
ChainCatcher Building the Web3 world with innovations.