AI 2027 · техническо приложение

Приложение T: Новата стратегия на OpenBrain за съгласуване

Пълният български превод, source mapping и свързаните визуализации са интегрирани.

Приложение T2 мин. четенеSource стр. 67–68
В тази част

Новата стратегия на OpenBrain за съгласуване

Източник: страница 67

Бележка: През целия процес ИИ извършват по-голямата част от интелектуалната работа и цялото програмиране. Затова напредъкът е толкова бърз; на стотици водещи човешки изследователи биха били нужни много години. Хората обаче остават важни именно защото не се доверяват напълно на системите. Необходими са хора от плът и кръв, които да четат докладите за експерименти и аргументите за безопасност, да спорят помежду си и — надяваме се — да намерят безопасен път напред.

Стъпка 1: Обучаване и внедряване на Safer-1 — несъгласуван, но контролиран автономен изследовател. Контролът е възможен, защото моделът е прозрачен за човешките надзорници: мисли чрез английска верига на разсъждение (CoT), а техники за нейната достоверност премахват евфемизмите, стеганографията и фините пристрастия.

Стъпка 2: Изпробване на различни обучителни среди за Safer-1 и внимателно четене на CoT, за да се установи кои цели и принципи от Спецификацията са се „закрепили“ и кои не.

Стъпка 3: Обучаване и внедряване на Safer-2 — съгласуван и контролиран автономен изследовател със същата архитектура, но с по-добра среда, която този път насърчава правилните цели и принципи.

Източник: страница 68

Приложение T - Новата стратегия за съгласуване на OpenBrain

Ето кратък непълен списък с техники, които могат да бъдат включени в по-добра среда за обучение:

• Ограничете ситуационната осведоменост по време на някои части от обучението, за да направите фалшифицирането на съгласуването много по-малко вероятно.

• Използвайте дебат и други мащабируеми схеми за надзор за по-надеждно стимулиране на истината.

• Отслабено състезателно обучение, red teaming и моделни организми.

• Отделяне на по-голям дял от изчислителния бюджет за съгласуване — например 40% вместо 1%.

Стъпка 4: Проектиране, обучение и внедряване на Safer-3 — далеч по-интелигентен автономен изследовател с по-напреднала архитектура, сходна със старата Agent-4. Той вече не е прозрачен за хората, но е прозрачен за Safer-2, което би трябвало да позволи едновременното му съгласуване и контролиране.

Стъпка 5: Неограничено повторение на стъпка 4 — верига от все по-мощни и по-съгласувани ИИ, всеки надзираван от предишното звено, включително аналози на Agent-5 от другия клон.