Итеративна дестилация и усилване (IDA)
Източник: страница 49
Итеративна дестилация и усилване
Концептуална схема
Модел M0 се усилва чрез повече inference compute, после резултатът се дестилира в M1; цикълът се повтаря до Mmax.
Оригинална web схема на описания в източника цикъл, с attribution към Ord (2025).
AI-2027-original.pdf, стр. 49 · Ord (2025)Покажи точните данни и текстовия еквивалент
| Стъпка | Вход | Операция | Резултат |
|---|---|---|---|
| 1 | M0 | Усилване / search | Amp(M0) |
| 2 | Amp(M0) | Дестилация | M1 |
| 3 | M1...Mmax | Повторение | по-висока способност |
Самоусъвършенстването на общия интелект и преди е постигало скромни успехи. В началото на 2027 г. обаче носи огромна възвръщаемост. Двете необходими съставки на IDA са:
• Усилване: При даден модел M0 влагате повече ресурс, за да подобрите резултата — оставяте модела да мисли по-дълго, изпълнявате много копия паралелно или правите и двете. Добавяте също толкова интензивно оценяване и запазвате само най-добрите отговори. Така изразходвате с порядъци повече изчислителен ресурс, но получавате осезаемо по-качествени отговори или работни продукти. Нека наречем тази скъпа система Amp(M0).
• Дестилация: При усилен модел Amp(M0) обучавате нов модел M1 да го имитира — да постига същите резултати, но по-бързо и с по-малко изчисления. В идеалния случай получавате по-интелигентния M1, след което повтаряте цикъла.
Визуализация на IDA от Ord, 2025 г.
Източник: страница 50
AlphaGo е обучен по този начин: търсенето по дърво Монте Карло и самообучението чрез игра са стъпката на усилване, а обучението с подкрепление — стъпката на дестилация. Това води до свръхчовешко представяне в го. Сега Agent-3 прилага същия подход, за да достигне свръхчовешко програмиране.
• При усилването Agent-3 мисли по-дълго, използва инструменти, допитва се до други ИИ или съчетава тези подходи. Така често открива своя грешка или стига до ново прозрение. Процесът създава много обучителни данни: означени траектории на успешни и неуспешни изследователски опити. Включва и техники като „най-доброто от N“ при проверими задачи, след което се запазват най-добрите траектории.
• Дестилацията използва алгоритми за обучение с подкрепление чрез градиент на политиката, за да вложи усиленото разсъждение в самия модел. OpenBrain вече е открила по-добри RL алгоритми от семейството на проксималната оптимизация на политиката (PPO). Изводите, до които Agent-3 стига след продължително мислене, се дестилират в единични стъпки; това подобрява онова, което може да постигне с една стъпка, и цикълът продължава.
Ранни версии на IDA от години работят при лесно проверими задачи, например математически и програмни задачи с ясен отговор. Причината е, че техниките за усилване често зависят от достъп до надежден сигнал за верния резултат.
Сега моделите вече оценяват достатъчно добре и по-субективни неща, например качеството на даден работен продукт. Това позволява IDA да подобрява модела в много повече задачи.
Източникови връзки
- https://ai-2027.com/research/timelines-forecast
- https://ai-alignment.com/iterated-distillation-and-amplification-157debfd1616
- https://arxiv.org/abs/1707.06347
- https://arxiv.org/abs/1810.08575
- https://arxiv.org/pdf/2210.11610
- https://arxiv.org/pdf/2412.03556
- https://arxiv.org/pdf/2503.14499
- https://en.wikipedia.org/wiki/AlphaGo
- https://github.com/deepseek-ai/DeepSeek-R1
- https://openai.com/index/chain-of-thought-monitoring/
- https://www.tobyord.com/writing/inference-scaling-reshapes-ai-governance