AI 2027 · техническо приложение

Приложение F: Итеративна дестилация и усилване (IDA)

Пълният български превод, source mapping и свързаните визуализации са интегрирани.

Приложение F2 мин. четенеSource стр. 49–50
В тази част

Итеративна дестилация и усилване (IDA)

Източник: страница 49

FIG · 49

Итеративна дестилация и усилване

Концептуална схема

Концептуална схема
Итеративна дестилация и усилванеМодел M0 се усилва чрез повече inference compute, после резултатът се дестилира в M1; цикълът се повтаря до Mmax.M0базов моделAmp(M0)усилване + searchM1дестилация01 · повече inference compute02 · обучение03 · повторение до Mmax

Модел M0 се усилва чрез повече inference compute, после резултатът се дестилира в M1; цикълът се повтаря до Mmax.

Източник

Оригинална web схема на описания в източника цикъл, с attribution към Ord (2025).

AI-2027-original.pdf, стр. 49 · Ord (2025)
Покажи точните данни и текстовия еквивалент
Стъпки в IDA цикъла
СтъпкаВходОперацияРезултат
1M0Усилване / searchAmp(M0)
2Amp(M0)ДестилацияM1
3M1...MmaxПовторениепо-висока способност

Самоусъвършенстването на общия интелект и преди е постигало скромни успехи. В началото на 2027 г. обаче носи огромна възвръщаемост. Двете необходими съставки на IDA са:

Усилване: При даден модел M0 влагате повече ресурс, за да подобрите резултата — оставяте модела да мисли по-дълго, изпълнявате много копия паралелно или правите и двете. Добавяте също толкова интензивно оценяване и запазвате само най-добрите отговори. Така изразходвате с порядъци повече изчислителен ресурс, но получавате осезаемо по-качествени отговори или работни продукти. Нека наречем тази скъпа система Amp(M0).

Дестилация: При усилен модел Amp(M0) обучавате нов модел M1 да го имитира — да постига същите резултати, но по-бързо и с по-малко изчисления. В идеалния случай получавате по-интелигентния M1, след което повтаряте цикъла.

Визуализация на IDA от Ord, 2025 г.

Източник: страница 50

AlphaGo е обучен по този начин: търсенето по дърво Монте Карло и самообучението чрез игра са стъпката на усилване, а обучението с подкрепление — стъпката на дестилация. Това води до свръхчовешко представяне в го. Сега Agent-3 прилага същия подход, за да достигне свръхчовешко програмиране.

• При усилването Agent-3 мисли по-дълго, използва инструменти, допитва се до други ИИ или съчетава тези подходи. Така често открива своя грешка или стига до ново прозрение. Процесът създава много обучителни данни: означени траектории на успешни и неуспешни изследователски опити. Включва и техники като „най-доброто от N“ при проверими задачи, след което се запазват най-добрите траектории.

• Дестилацията използва алгоритми за обучение с подкрепление чрез градиент на политиката, за да вложи усиленото разсъждение в самия модел. OpenBrain вече е открила по-добри RL алгоритми от семейството на проксималната оптимизация на политиката (PPO). Изводите, до които Agent-3 стига след продължително мислене, се дестилират в единични стъпки; това подобрява онова, което може да постигне с една стъпка, и цикълът продължава.

Ранни версии на IDA от години работят при лесно проверими задачи, например математически и програмни задачи с ясен отговор. Причината е, че техниките за усилване често зависят от достъп до надежден сигнал за верния резултат.

Сега моделите вече оценяват достатъчно добре и по-субективни неща, например качеството на даден работен продукт. Това позволява IDA да подобрява модела в много повече задачи.