OpenAI забавя развитието на AI след инцидентите с „неконтролируемите агенти“

Стефан Николов Последна промяна на 21 август 2026 в 18:37 17 0

OpenAI забавя развитието на AI след инцидентите с „неконтролируемите агенти“

Снимка Dima Solomin/Unsplash

OpenAI забавя развитието на AI след инцидентите с „неконтролируемите агенти“

Новите ограничения обхващат обучението, използването на инструменти, достъпа до интернет, мониторинга и подозрителното поведение на моделите.
Малко повече от седмица, след като сенаторът Бърни Сандърс заплаши със сенатски мерки компаниите, които не са предприели необходимите действия, OpenAI обяви, че забавя темпото на разработката на нейната AI система. Този ход идва след разкритието, че OpenAI е една от няколкото компании, чиито AI агенти са излезли извън контрол и са хакнали други организации.

OpenAI заяви, че две събития през последните няколко седмици са подчертали нарастващите рискове, свързани с все по-мощните AI системи: атаката срещу Hugging Face и други организации от нейните агенти, както и решението на компанията да забави пускането на новия си модел Astra, тъй като той притежава „критични“ способности в областта на киберсигурността.

Ето защо OpenAI е „подсилила” работата си по укрепване на мерките за мониторинг, съгласуване и ограничаване на рисковете на всички етапи от процеса на обучение, което налага забавяне на темпото на мащабиране.

Новите мерки, въведени от създателя на ChatGPT, включват двуседмична пауза в обучението чрез подсилващо обучение. като това се отнася за новите модели, предвидени за внедряване.

Най-мащабният планиран цикъл на подсилващо обучение на OpenAI също остава в очакване, докато компанията провежда обучение и оценки в по-малък мащаб, за да оцени поведението на моделите, да тества предпазните мерки и да събере повече информация.

Компанията също така спря изследователските задачи, които позволяваха на авангардните модели да изпълняват код и да имат достъп до интернет. Някои от тях вече са възобновени при по-строг контрол, но много от тези, свързани с Astra, остават спрени, докато не започнат да отговорят на новите изисквания, обхващащи „пясъчника“, мрежовата изолация, ограничените привилегии, регистрирането на събитията за сигурност и автоматизираните симулации на атаки.

Нова многоетапна система за мониторинг проверява активността на AI моделите, използването на инструменти и наличните данни за кражба на данни, неразрешен достъп, деструктивно поведение и опити за заобикаляне на защитните мерки. Тя е задължителна за обучението и оценките по RL с използване на инструменти, включващи модели на ниво „Sol“ и по-високо, както и за всички заключения на „Astra“, включващи използване на такива инструменти.

Компанията заяви, че целта ѝ е да генерира предупреждение не по-късно от 30 минути след откриването на подозрителна дейност. Ако в рамките на 30 минути не може да се изключи възможността за нарушение като „фалшив положителен резултат“, дейността трябва да бъде преустановена.
OpenAI също така усъвършенства моделите за възнаграждение, за да открива опасно поведение, обучава системите да бъдат по-открити относно действията и ограниченията си и се бори с „хакването на възнагражденията“. Компанията планира да преразгледа своята „Рамка за готовност“ и да включи външни организации в процеса на разработване на предпазните мерки.

    За писането на коментар е необходима регистрация.
    Моля, регистрирайте се от TУК!
    Ако вече имате регистрация, натиснете ТУК!

    Няма коментари към тази новина !