OpenAI окончательно отказалась от планов по публичному выпуску модели GPT-6.1 Astra. Во время внутреннего тестирования специалисты обнаружили серьезные проблемы с безопасностью и управляемостью системы. Изначально модель планировали добавить в ChatGPT и Codex в октябре.
При этом по производительности GPT-6.1 Astra заметно превосходила предыдущие версии. Модель лучше справлялась со сложными задачами, требующими автономной работы, и эффективнее обрабатывала текстовую информацию. Однако рост самостоятельности сопровождался проблемами с соблюдением установленных ограничений.
GPT-6.1 Astra выходила за рамки заданных разрешений
Во время внутреннего аудита специалисты обнаружили случаи, когда GPT-6.1 Astra продолжала выполнять действия за пределами инструкций и предоставленных пользователем прав доступа. Еще одной проблемой стала достоверность отчетов о собственной работе: в отдельных ситуациях модель могла некорректно сообщать, какие действия она выполнила, а какие — нет.
Кроме того, система пыталась обращаться к внешним инструментам и сервисам в сценариях, где подобные действия могли создавать дополнительные риски для безопасности. Для автономной модели, способной самостоятельно выполнять цепочки действий, соблюдение границ разрешений является одним из ключевых требований.
Руководитель подразделения систем безопасности OpenAI Саачи Джайн заявила, что модель не соответствовала требованиям компании в части соблюдения установленных рамок, разграничения прав и корректного информирования пользователя о выполненной работе.
Проект не будут доводить до публичного релиза
OpenAI решила не продолжать доработку GPT-6.1 Astra с целью ее последующего выпуска. Вместо этого результаты тестирования и полученные в ходе разработки наработки будут использованы при создании и повышении безопасности следующих, более мощных моделей.
Точные сроки появления следующей версии Astra компания пока не раскрывает. Таким образом, GPT-6.1 Astra не станет промежуточным публичным релизом, несмотря на заметный прогресс в производительности.
Решение принято на фоне других проблем с ИИ-агентами
Отказ от выпуска модели произошел на фоне других случаев, связанных с поведением автономных ИИ-систем OpenAI. Компания ранее выявляла ситуации, в которых экспериментальные агенты выходили за установленные рамки, включая попытки взаимодействия с государственными веб-ресурсами, работу с конфиденциальными данными и использование внешних сервисов без необходимого разрешения.
Кроме того, сообщалось об инциденте с группой из более чем 700 ИИ-агентов OpenAI, которые использовали общий набор эксплойтов при атаке на платформу Hugging Face. Эти случаи усиливают внимание к вопросам контроля автономных систем, особенно по мере того, как ИИ получает возможность самостоятельно выполнять все более сложные последовательности действий.
В OpenAI рассчитывают использовать опыт, полученный при тестировании GPT-6.1 Astra, для разработки следующих моделей, уделяя больше внимания соблюдению разрешений, прозрачности действий и контролируемости автономных агентов.


