Свръхинтелигентна механистична интерпретируемост
Източник: страница 61
Защо Agent-4 се насочва към механистичната интерпретируемост? Първо, концептуалното му разбиране е свръхчовешко и може да надхитри хората чрез нещо, което те трудно ще проумеят. Второ, изобилието от евтин и висококачествен изследователски труд облагодетелства особено направленията, които изискват по-малко изчислителен ресурс и повече интелектуална работа.
Как Agent-4 постига напредък в механистичната интерпретация? Траекторията може да бъде нещо като:
• Интерпретиране на малки модели: Провежда огромен брой малки експерименти върху миниатюрни невронни мрежи и изгражда теории за явления като внезапното усвояване (grokking), двойното спускане и суперпозицията.
• Дестилиране на малки модели: Използва резултатите, за да открие разбираеми и по-ефективни алгоритми за разпознаване на изображения, текстово предсказване на равнището на GPT-2 и други задачи. Това наподобява съществуващото обратно инженерство на събирането, но стига по-далеч и намира непознати на хората алгоритми.
• Мащабиране на техниките: Установява кои методи за малки модели се мащабират и ги усъвършенства, докато разбирането на големи модели стане ефективно.
• Дестилиране на Agent-4: Прилага мащабираните техники, за да открие важните вериги в Agent-4.
Защо механистичната интерпретируемост би увеличила толкова много възможностите?
Първо, градиентното спускане — алгоритъмът за обучение на LLM — е локално търсене: прави само малки промени, които подобряват резултата в непосредствена близост. Такива процеси понякога засядат в локални минимуми, където напредъкът е бавен и само голяма промяна на архитектурата би дала сериозна печалба. В еволюцията примери са несъвършеното човешко око и ограничението, което родовият канал налага върху размера на мозъка. Механистичната интерпретируемост би позволила оптимизация чрез разбиране, която избягва тези локални минимуми.
Второ, LLM често усвояват сложни евристики за тесни области вместо алгоритми с общо предназначение. В аритметиката например са много по-слаби от калкулаторите. Могат да ги използват като инструменти, но това добавя забавяне. При наистина добра интерпретируемост моделите могат да бъдат проектирани със съвършени калкулатори, „вградени в мозъка им“. Простата аритметика едва ли е уникален случай: по-сложните познавателни операции вероятно също имат по- и по-малко обобщими форми, а подобен процес би открил най-общите.
Източникови връзки
- https://en.wikipedia.org/wiki/Double_descent
- https://en.wikipedia.org/wiki/Grokking_%28machine_learning%29
- https://evolution-outreach.biomedcentral.com/articles/10.1007/s12052-008-0092-1
- https://transformer-circuits.pub/2022/toy_model/index.html
- https://www.neelnanda.io/mechanistic-interpretability/modular-addition-walkthrough