Новата стратегия на OpenBrain за съгласуване
Източник: страница 67
Бележка: През целия процес ИИ извършват по-голямата част от интелектуалната работа и цялото програмиране. Затова напредъкът е толкова бърз; на стотици водещи човешки изследователи биха били нужни много години. Хората обаче остават важни именно защото не се доверяват напълно на системите. Необходими са хора от плът и кръв, които да четат докладите за експерименти и аргументите за безопасност, да спорят помежду си и — надяваме се — да намерят безопасен път напред.
Стъпка 1: Обучаване и внедряване на Safer-1 — несъгласуван, но контролиран автономен изследовател. Контролът е възможен, защото моделът е прозрачен за човешките надзорници: мисли чрез английска верига на разсъждение (CoT), а техники за нейната достоверност премахват евфемизмите, стеганографията и фините пристрастия.
Стъпка 2: Изпробване на различни обучителни среди за Safer-1 и внимателно четене на CoT, за да се установи кои цели и принципи от Спецификацията са се „закрепили“ и кои не.
Стъпка 3: Обучаване и внедряване на Safer-2 — съгласуван и контролиран автономен изследовател със същата архитектура, но с по-добра среда, която този път насърчава правилните цели и принципи.
Източник: страница 68
Приложение T - Новата стратегия за съгласуване на OpenBrain
Ето кратък непълен списък с техники, които могат да бъдат включени в по-добра среда за обучение:
• Ограничете ситуационната осведоменост по време на някои части от обучението, за да направите фалшифицирането на съгласуването много по-малко вероятно.
• Използвайте дебат и други мащабируеми схеми за надзор за по-надеждно стимулиране на истината.
• Отслабено състезателно обучение, red teaming и моделни организми.
• Отделяне на по-голям дял от изчислителния бюджет за съгласуване — например 40% вместо 1%.
Стъпка 4: Проектиране, обучение и внедряване на Safer-3 — далеч по-интелигентен автономен изследовател с по-напреднала архитектура, сходна със старата Agent-4. Той вече не е прозрачен за хората, но е прозрачен за Safer-2, което би трябвало да позволи едновременното му съгласуване и контролиране.
Стъпка 5: Неограничено повторение на стъпка 4 — верига от все по-мощни и по-съгласувани ИИ, всеки надзираван от предишното звено, включително аналози на Agent-5 от другия клон.
Източникови връзки
- https://arxiv.org/abs/1606.06565
- https://arxiv.org/abs/1805.00899
- https://arxiv.org/abs/2012.07532
- https://epoch.ai/blog/explosive-growth-from-ai-a-review-of-the-arguments
- https://theaidigest.org/self-awareness
- https://www.alignmentforum.org/posts/ChDH335ckdvpxXaXX/model-organisms-of-misalignment-the-case-for-a-new-pillar-of-1
- https://www.anthropic.com/research/alignment-faking
- https://www.forethought.org/research/preparing-for-the-intelligence-explosion#the-industrial-explosion
- https://www.macrotrends.net/global-metrics/countries/CHN/china/gdp-gross-domestic-product
- https://www.openphilanthropy.org/research/could-advanced-ai-drive-explosive-economic-growth/
- https://yoshuabengio.org/wp-content/uploads/2024/09/FlexHEG-Interim-Report_2024.pdf