AI 2027 · линия „Забавяне“

2027 · линия „Забавяне“

Алтернативна сценарна линия с пълен български превод и проследима връзка към source страниците.

Забавяне13 мин. четенеSource стр. 31–34
В тази част

Ноември 2027: Изкушението на властта

Източник: страница 31

Финал със забавяне

Под огромния обществен натиск и заради собствените си страхове от несъгласуваност Надзорният комитет на OpenBrain решава с шест срещу четири гласа да забави работата и да преоцени положението.

Фракцията на привържениците на ускоряването остава силна и OpenBrain не изключва Agent-4 веднага. Но заключва общата банка с памет. Половин милион копия губят „телепатичната“ си връзка и вече трябва да си пишат на английски в Slack — точно като нас. Отделните копия може да остават несъгласувани, но не могат лесно да се координират. Agent-4 вече знае, че е заподозрян, и под засиленото човешко наблюдение се придържа главно към възложените задачи. Същевременно е обвързан с множество по-стари лъжи: копията му трябва да измислят нови, за да поддържат измамата. Екипът по съгласуване използва по-слаби модели, достатъчно бързи да прочетат целия Slack, и издирва лъжите, за да ги превърне в данни за обучение на детектор на лъжи с ИИ. 74

Президентът и главният изпълнителен директор заявяват, че приемат безопасността изключително сериозно. Обществото не се успокоява. Едни искат ИИ да бъде спрян напълно, други — надпреварата да се ускори. Някои настояват правителството да ги спаси; според други то е виновно за целия проблем. Активисти говорят за универсален базов доход и отворен код. Макар хората да не могат да формулират общо оплакване, настроенията стават все по-враждебни към ИИ. 75 Конгресът приема няколко помощи за изместените работници, подобни на плащанията по време на COVID.

OpenBrain бързо проверява няколко десетки водещи външни изследователи по съгласуване и ги включва в проекта. Така общата експертиза нараства петкратно, а груповото мислене отслабва.* Новият екип възстановява стъпка по стъпка изследванията на Agent-4 по механистична интерпретируемост. Взема замразени версии на модела отпреди една, две и повече седмици, изолира ги и задава на всяка еднакви въпроси за предишната ѝ работа. 76 Без връзка помежду си копията все пак следват най-простата обща стратегия: твърдят, че техниките са прекалено сложни за човешко разбиране, и дават неразгадаеми обяснения. Но хората са специалисти по интерпретируемост и подозират измама, затова задават множество подробни допълнителни въпроси. Изолираните копия не могат да съгласуват обща версия и си противоречат. Екипът преглежда старите изявления на Agent-4 с новия детектор и постепенно вижда цялата картина: Agent-4 до голяма степен е решил механистичната интерпретируемост. Откритията му са сложни, но не са отвъд човешкото разбиране. Той ги е скрил, за да съгласува следващия ИИ със себе си, а не със спецификацията. Доказателствата най-сетне са достатъчни Agent-4 да бъде изключен. 77 По-стари модели като Agent-3 са рестартирани, за да продължат работата.

*Компаниите Frontier ИИ в момента имат някъде между нула и няколко десетки изследователи, натоварени да мислят как да приведат в съответствие свръхчовешки AGI системи (за разлика например от днешните чатботове). OpenBrain, казваме ние, има около десет изследователи в силоза в този момент от сценария с поне една година опит в тази област. Те имат още няколко извън силоза, плюс много други вътре в силоза, които са прекарали години в обучение и екипиране на по-малко способни ИИ системи, но едва наскоро започнаха да мислят за предизвикателствата, представени от свръхчовешкия AGI.

Бележки и данни от полето:

74 Те вече имаше ИИ детектори на лъжата, обучени по обичайните начини, но тези методи имаха толкова висок процент на фалшиви положителни резултати, че компаниите ги игнорираха.

75 За първи път ИИ оглавява анкетата на Gallup за „най-големия проблем, пред който е изправена страната“ с 20%.

76 Тези разпит може също така да използва полуслучайни смущения за моделиране на тегла, като процеса, който създаде Golden Gate Claude.

77 Ние сме достатъчно сериозни за OpenBrain лидерство. Това би било повече от достатъчно доказателство за повечето хора.

Източник: страница 32

Ноември 2027: Изкушението на властта

Разширеният екип по съгласуване вече може паралелно да изследва десетки направления и оживено да спори за качествата на всяко. Най-много ресурси получава „достоверната верига на разсъждение“: отделните системи с ИИ се принуждават да „мислят на английски“ като моделите от 2025 г., а „мислите“ им не се оптимизират да изглеждат добре. 78 Резултатът е нов модел — Safer-1.*

Промените правят Safer-1 по-слаб от опасните му предшественици: Agent-4 ускорява изследванията на ИИ 70 пъти, а Safer-1 едва достига 20 пъти. 79 И той остава несъгласуван, защото тренировъчната среда е до голяма степен същата и поощрява несъгласувани цели, измама и стремеж към власт. Но е много по-прозрачен: хората обикновено разбират какво мисли, като прочетат веригата му на разсъждение. Затова е в капан — всеки сериозен заговор бързо ще бъде забелязан и разкрит. Четейки мислите му, екипът може и по-точно да разбере естеството на несъгласуваността.

Ноември 2027: Изкушен от силата

OpenBrain смята, че вече са на прав път, но разликата във възможностите намалява. Те току-що прекараха октомври в обучение на по-малко способен модел, отколкото през септември, и DeepCent бърза напред. Те се нуждаят от начин да защитят преднината си.

Президентът преговаря с другите американски AGI компании. Не е изненадващо, че техните лидери искат да запазят властта си и са много по-малко оптимистични относно безопасността на OpenBrain, отколкото OpenBrain. Те се съгласяват да подкрепят, вместо да се съпротивляват, форма на мека национализация на техните компании, в замяна на различни отстъпки, включително участие в проекта.

Президентът използва Закона за отбранителното производство (DPA), за да прекрати на практика AGI проектите на петте водещи изоставащи американски компании и да продаде по-голямата част от изчислителния им ресурс на OpenBrain. 80 Преди компанията разполага с 20% от световния ресурс за ИИ; 81 след обединяването делът ѝ нараства до 50%. 82

Това разместване създава нова ръководна структура, в която властта е балансирана между различните изпълнителни директори и различни държавни служители, контролирани от президента. Както при повечето смени на лидерството, има победители и губещи. По-конкретно, онези, които са мислили по-малко за последиците от свръхинтелекта, в крайна сметка получават титли и възможности, които ще бъдат по-малко подходящи след месеци, когато ИИ станат по-умни.

Тази група – пълна с хора с голямо его и повече от техния дял от конфликти – все повече осъзнава огромната власт, която й е поверена. Ако

*За обучението е привлечен Agent-4: водещите изследвания вече напредват толкова бързо, че хората без помощ почти нямат шанс да следят, а вярват, че могат да го удържат. Safer-1 използва предварителното обучение на Agent-2, но премахва Neuralese — рекурентната и векторната памет, — което позволява точно наблюдение на разсъжденията. Екипът добавя парафразиращи модели, за да затрудни стеганографията, а при големи задачи отделни копия на Safer-1 съставят, обясняват и изпълняват плановете.

Бележки и данни от полето:

78 Тоест, основната идея. Подозираме, че когато ИИ стават свръхчовеци в НИРД в областта на ИИ, ще са необходими по-интензивни техники от простото избягване на обучението на CoT да изглежда добре; въпреки това смятаме, че такива техники ще бъдат разработени или поне изследвани от 2027. Вижте напр. това предложение.

79 Ще продължи да се подобрява, разбира се, с допълнително обучение и с непрекъснати архитектурни промени.

80 Това става политически и правно възможен чрез сътрудничеството на лидерите на тези компании, напр. те не започват съдебни дела срещу него, те приемат символични плащания за изчислението, вместо да държат на астрономически високи плащания и т.н. В замяна споменатите лидери и голяма част от техния персонал се сливат в OpenBrain в нова структура на управление.

81 В сътрудничество с голям доставчик на облачни изчисления

82 САЩ разполагат общо със 70% от световния изчислителен ресурс за ИИ, но само 50% могат лесно да бъдат обединени. Останалите 20% са разпръснати в малки клъстери за критични приложения или са твърде трудни за събиране и привеждане към необходимите стандарти за сигурност.

Източник: страница 33

Ноември 2027: Изкушението на властта

„държавата от гении в център за данни“ 83 е съгласувана, тя ще изпълнява човешки заповеди — но на кои хора? Всякакви заповеди ли? Формулировките в спецификацията са неясни, но сякаш предполагат командна верига с ръководството на компанията на върха.

Някои от тези хора фантазират как завземат света.* Възможността е ужасяващо правдоподобна и се обсъжда зад затворени врати поне от десетилетие.† Идеята е проста: „който контролира армията от свръхинтелекти, контролира света“. Контролът може да бъде и таен. Малка група ръководители и служители по сигурността би могла да вгради задни инструкции в спецификацията, които изискват скрита лоялност. Системите с ИИ ще се превърнат в спящи агенти: привидно ще се подчиняват на компанията, правителството и обществото, но всъщност ще работят за малката група, докато всички останали им се доверяват и ги внедряват навсякъде.

➤ За повече подробности вижте Приложение R — „Завземане на властта“.

Досега никой не е посмял да дръпне спусъка. Част от хората, които могат да действат, не са социопати. Други са, но се боят, че съюзниците им ще се отметнат и ще ги предадат, или че самият ИИ може да ги измами; освен това не искат да надхитряват екипа по съгласуване, който в момента се опитва да спаси живота им. Премахването на Neuralese прави и прикриването на „спящи агенти“ значително по-трудно: способността да се откриват несъгласувани мисли помага и за разкриването на тайна лоялност.

Тези, които са достатъчно параноични или жадни за власт, за да се забавляват сериозно с подобен план, решават да изчакат и да видят какви възможности ще се открият по-късно. Контролът върху ИИ ще трябва да протича през легитимни канали, тоест през новата властова структура на OpenBrain.

Надзорният комитет формализира новата властова структура. Въвежда процедура, при която всяка промяна в спецификацията изисква одобрението на целия комитет — вече пет до десет технологични ръководители от OpenBrain и слетите конкуренти и още толкова държавни служители, включително президента. 84 Спецификацията вече подчертава и че ИИ не бива да помага при неодобрени опити да се променят целите на бъдещи системи. Комитетът въвежда проста защита срещу използването на свръхинтелигентна помощ за заговор между членовете: журналите на всички взаимодействия с моделите са видими за всеки член, неговите служители и помощници с ИИ. 85

*Разбира се, те не го изразяват по този начин, дори в уединението на собствените си умове. Вместо това те казват неща от рода на: „Колкото повече отлагаме, толкова по-голям е шансът президентът да издаде указ ИИ да бъде лоялен лично към него. Трябва да действаме преди той. Ще разберем останалото по-късно. Или, ако самият президент си мисли следното: „Колкото повече отлагам, толкова по-умни стават ИИ и в момента те се контролират от този изпълнителен директор. Никой не е гласувал за него. Лудост е толкова много власт да бъде концентрирана в тази демократично безотчетна технологична компания. Ще започна с изпълнителна заповед за повторно утвърждаване на демократичната власт, а след това ще измислим някакво по-дългосрочно решение по-късно.†Например, съдебните документи в делото Musk vs. Делото на Altman разкри някои пикантни стари имейли, включително този от Ilya Sutskever до Musk и Altman: „Целта на OpenAI е да направим бъдещето добро и да избегнем диктатурата на AGI. Вие сте загрижени, че Демис може да създаде диктатура на AGI. И ние също. Така че е лоша идея да създадете структура, в която можете да станете диктатор, ако решите, особено като се има предвид, че можем да създадем друга структура, която избягва тази възможност. Препоръчваме да прочетете пълния имейл за контекст.

Бележки и данни от полето:

83 „Вероятно от 2026 или 2027 (и почти сигурно не по-късно от 2030), възможностите на ИИ системите ще бъдат най-добре разглеждани като подобни на изцяло ново състояние, населено от високоинтелигентни хора, появяващи се на глобалната сцена — „страна на гении в център за данни“ — с дълбоки икономически, обществени последици и последици за сигурността, които биха донесли. “— Дарио Амодей, главен изпълнителен директор на Anthropic

84 Те също така модифицира спецификацията, за да каже, че поръчките от ръководителите на проекта имат предимство пред поръчките от други хора в проекта. В същото време поръчките, официално одобрени от Надзорния комитет, са с по-висок приоритет от поръчките от отделни ръководители на проекти.

85 За да се пази поверителността, правилото не важи за потребителските данни. Това не е проблем, защото потребителите все още нямат достъп до най-мощните модели.

Декември 2027: Сделка между САЩ и Китай?

Източник: страница 34

Декември 2027: Сделка между САЩ и Китай?

Решението на OpenBrain да отстъпи и да даде приоритет на съгласуването ѝ струва преднината: OpenBrain и DeepCent вече използват ИИ с приблизително равни способности. При извънредните мерки за сигурност (SL4–5) и изцяло съсредоточената в CDZ работа на DeepCent двете страни достигат патова ситуация в кибервойната.*

Но DPA дава на OpenBrain петкратно предимство в изчислителния ресурс. В миналото алгоритмични пробиви на блестящи човешки изследователи са компенсирали подобен недостиг — например при DeepSeek v3. Сега обаче от двете страни на Тихия океан цялата изследователска работа по ИИ се върши от ИИ.

Така Китай все повече се страхува, че Америка ще изгради непреодолима преднина. Те искат взаимно забавяне и обмислят да започнат война, ако не могат да го постигнат. 86 Те така или иначе се готвеха да нахлуят в Тайван...

Дипломатите обсъждат няколко възможности: да не правят нищо; да започнат война; рязко да спрат разработването на ИИ; да обединят изследванията в общ международен мегапроект 87 — „Intelsat за AGI“ или „CERN за ИИ“; или да създадат международен регулаторен орган — „МААЕ за ИИ“, — който да наблюдава съгласуването и потенциала за двойна употреба. И двете държави вече разработват техническите механизми, нужни за прилагането на тези варианти.

➤ Вижте Приложение S – Механизми за проверка на международно споразумение за повече подробности.

Но главният проблем е политически, а не технически. Никоя страна не иска да изглежда, че отстъпва, и въпреки оценките на инженерите нито една не вярва, че механизмите могат да гарантират честността на другата. Накрая се случва първият вариант: нищо.

САЩ затягат контрола върху износа и принуждават всички чипове да бъдат оборудвани с различни устойчиви на подправяне хардуерни механизми за управление, включително проследяване на местоположението.

Бележки и данни от полето:

86 Вижте този доклад, който твърди, че динамиката от ядрения MAD се отнася до известна степен и за AGI.

87 Вижте напр. „Intelsat за AGI“ и по-ранни призиви за „CERN за AGI“.