В разговорах об искусственном интеллекте прижилось словечко, которое звучит куда прозаичнее, чем «перцептрон», «свёртка» или «трансформер», но имеет куда более далеко идущие последствия — timeline, личный прогноз сроков. Достаточно спросить любого специалиста про его timeline, и он назовёт год, когда, по его мнению, появится AGI — универсальный искусственный интеллект, который иногда определяют как систему, способную решать большинство задач не хуже человека. По мере того как модели набирали масштаб — за счёт более быстрых вычислителей, более удачных алгоритмов и растущих объёмов данных, — эти сроки сжимались. Руководители крупнейших лабораторий, включая OpenAI, Anthropic и Google DeepMind, уже говорят о нескольких годах.
Источник изображения — spectrum.ieee.org
Машина, которая рассуждает похоже на человека, сделала бы возможным по-настоящему тесное сотрудничество с людьми. И ближайшие, и отдалённые последствия появления AGI пока неясны, но изменения ожидаются в экономике, в темпах научных открытий и в геополитике. А если AGI приведёт к сверхинтеллекту, речь пойдёт уже о месте человечества в пищевой цепочке. Именно поэтому так важно измерять прогресс технологии заранее: оценка способностей моделей — это то, на чём строятся законы, инженерные цели, общественные нормы и бизнес-модели.
Для читателя в СНГ у этой академической дискуссии есть вполне земное измерение. От того, какой набор тестов отрасль признает стандартом, зависит, какие модели будут закупать компании и государства, как их будут сертифицировать и регулировать, какие рабочие процессы автоматизируют в первую очередь и на что реально стоит рассчитывать при внедрении ИИ в бизнес. Маркетинговая формулировка «наша модель почти достигла AGI» без ссылки на конкретный бенчмарк не значит ничего.
Измерять любую интеллектуальную способность трудно, но с AGI ситуация особая. Причина в том, что люди принципиально расходятся в определениях: одни привязывают AGI к результатам на бенчмарках, другие — к устройству системы изнутри, третьи — к экономическому эффекту, четвёртые опираются на общее впечатление. Так что первый шаг к измерению машинного интеллекта — договориться хотя бы о самом понятии.
Существуют и виды интеллекта, которые обычно не проверяются тестами IQ и тем более почти недоступны нынешним бенчмаркам. Это, например, социальный интеллект — способность делать выводы о чужих намерениях и состояниях, — и физический интеллект: понимание причинных связей между объектами и силами, умение согласованно управлять телом в пространстве. И то и другое критично для человека в сложных ситуациях, а значит, тест, который их игнорирует, измеряет лишь часть картины.
Умный Ганс, немецкий конь начала XX века, казалось, умел считать, но на деле реагировал на едва заметные подсказки дрессировщика — классический пример неверно истолкованного результата. Источник изображения — spectrum.ieee.org
Тестирование интеллекта — хоть у людей, хоть у животных, хоть у машин — уязвимо сразу с двух сторон: возможны и ложноположительные, и ложноотрицательные результаты. Испытуемый может выглядеть умным просто потому, что нашёл обходной путь, как знаменитый Умный Ганс — конь, который якобы считал в уме, а на деле считывал невербальные подсказки. А может выглядеть глупым только оттого, что не понял процедуру теста или не различает предъявленный ему материал.
Сложность ещё и в том, что представления об интеллекте меняются от эпохи к эпохе и от культуры к культуре. «В обществе происходит интересный сдвиг в том, что мы считаем интеллектом и какие его стороны ценим», — отмечает Анна Иванова, доцент кафедры психологии в Технологическом институте Джорджии. До появления энциклопедий и интернета признаком ума считался большой запас фактов в голове. Сегодня всё больше ценится подвижный интеллект — умение соображать в новой ситуации, а не кристаллизованный запас знаний.
Как менялись «великие вызовы» для машинного интеллекта
За десятилетия машинам не раз предлагали задачи, которые якобы требовали интеллекта человеческого уровня. В 1958 году трое видных исследователей ИИ писали: «Шахматы — интеллектуальная игра par excellence… Если бы удалось создать успешную шахматную машину, казалось бы, что мы проникли в самую сердцевину человеческой интеллектуальной деятельности». Они допускали теоретическую возможность, что такая машина «могла бы обнаружить нечто вроде колеса по отношению к человеческой ноге: устройство, совершенно непохожее на человека по методам, но чрезвычайно эффективное по-своему и, возможно, очень простое». И тут же отвергали её: ничего подобного, по их словам, на горизонте не просматривалось. В 1997-м это «нечто подобное» просматривалось уже вполне отчётливо: Deep Blue от IBM обыграл действующего чемпиона мира Гарри Каспарова, не обладая при этом даже той универсальностью, которая нужна для игры в шашки.
Deep Blue от IBM обыграл чемпиона мира по шахматам Гарри Каспарова в 1997 году, но его универсальности не хватило бы даже на игру в шашки. Источник изображения — spectrum.ieee.org
В 1950 году Алан Тьюринг предложил «игру в имитацию» — в одной из версий машина должна выдать себя за человека в переписке. «Метод вопросов и ответов, по-видимому, годится для того, чтобы затронуть почти любую область человеческой деятельности, какую мы захотим включить», — писал он. Несколько десятилетий прохождение того, что сейчас называют тестом Тьюринга, считалось практически недостижимой планкой и надёжным признаком AGI.
Но в этом году исследователи сообщили: когда участники по пять минут переписывались одновременно с человеком и с моделью GPT-4.5, а затем угадывали, кто есть кто, они называли человеком именно ИИ в 73% случаев. При этом ведущие языковые модели регулярно допускают ошибки, каких почти не сделает ни один человек, — например, сбиваются при подсчёте букв «r» в слове strawberry. Это скорее «колесо», чем «нога». Поэтому поиск метрик человекоподобного интеллекта, которые нельзя было бы «взломать» обходным путём, продолжается.
Показательно, как именно тест Тьюринга утратил статус решающего экзамена. Он проверяет не способность рассуждать, а способность убеждать собеседника в своей человечности — а это разные вещи. Языковая модель, обученная на гигантских объёмах человеческой переписки, отлично воспроизводит её интонацию, включая опечатки, паузы и уход от неудобных вопросов. Поэтому высокий процент «узнавания человеком» сегодня говорит скорее о качестве имитации стиля, чем об уровне понимания.
ARC: тест, на котором модели до сих пор спотыкаются
Один бенчмарк, при всех его недостатках, стал фактическим индикатором для каждой новой передовой модели. В 2019 году Франсуа Шолле — тогда инженер Google, а сейчас сооснователь стартапа Ndea — опубликовал работу «On the Measure of Intelligence». Многие приравнивают интеллект к набору умений, а универсальный интеллект — к очень широкому набору. Шолле смотрит на это уже: по-настоящему важным он считает единственное умение — способность легко осваивать новые умения. Большие языковые модели показывают отличные результаты на массе тестов, но лишь после обучения на триллионах слов; столкнувшись с ситуацией, непохожей на обучающие данные, они часто беспомощны. В терминах Шолле это и означает отсутствие интеллекта.
Вместе со статьёй Шолле выпустил бенчмарк ARC (Abstraction and Reasoning Corpus). Это сотни визуальных головоломок, в каждой — несколько примеров-демонстраций и одно задание. Демонстрация состоит из входной и выходной сетки, заполненных цветными клетками. В задании дана только входная сетка. Нужно вывести правило из примеров и применить его, построив новую выходную сетку.
Бенчмарк Abstraction and Reasoning Corpus требует вывести абстрактное правило всего из нескольких примеров: по парам «вход — выход» система должна применить скрытую закономерность к новому заданию — человеку это даётся легко, машинам до сих пор трудно. Источник изображения — spectrum.ieee.org
ARC нацелен именно на подвижный интеллект. «Чтобы решить любую задачу, нужны какие-то знания, а дальше вы на ходу их перекомбинируете», — поясняет Шолле. Чтобы тест проверял не объём накопленного, а способность к перекомбинации, обучающие головоломки должны выдавать все необходимые «базовые априорные знания»: целостность объекта, симметрию, счёт — тот здравый смысл, которым владеет уже маленький ребёнок. Люди решают большинство задач ARC без труда, а ИИ поначалу буксовал. В итоге OpenAI собрала версию рассуждающей модели o3, обошедшую среднего человека с результатом 88%, — правда, при оценочной стоимости вычислений около 20 тысяч долларов на одну головоломку. Эту модель так и не выпустили, поэтому в публичной таблице результатов её нет.
В марте появилась усложнённая версия — ARC-AGI-2, которой занимается созданная Шолле некоммерческая организация ARC Prize Foundation. Её заявленная миссия — служить «полярной звездой» на пути к AGI за счёт бенчмарков, устойчивых во времени. Призовой фонд — миллион долларов, основная часть достанется командам, чьи модели решат 85% из 120 новых головоломок, уложившись в четыре графических ускорителя и 12 часов работы. Ограничение по железу здесь не формальность: оно отсекает решения, которые берут задачу грубым перебором за десятки тысяч долларов. Новые задачи сложнее образца 2019 года — иногда требуется применить сразу несколько правил, провести многошаговое рассуждение или расшифровать символы. Средний человек набирает 60%, лучший результат ИИ на момент публикации — около 16%.
Модели постепенно продвигались на первой версии ARC-AGI, представленной в 2019 году. В этом году ARC Prize запустила новую версию с более сложными головоломками, на которой модели буксуют. Пометки low, medium, high и thinking показывают, сколько вычислений модель тратит на ответ; больше всего расходуют «думающие» модели. Источник изображения — spectrum.ieee.org
Специалисты признают ценность ARC, но видят и его ограничения. Цзясюань Ю, специалист по компьютерным наукам из Иллинойсского университета в Урбане-Шампейне, называет ARC «очень хорошим теоретическим бенчмарком», который проясняет, как устроены алгоритмы, но «не учитывает реальную сложность прикладных задач ИИ — например, социальных рассуждений».
Мелани Митчелл из Института Санта-Фе говорит, что тест «схватывает некоторые интересные человеческие способности», в частности умение вывести новое правило из пары примеров. Но из-за узкого формата задания, по её словам, он не отражает того, что люди обычно вкладывают в понятие универсального интеллекта.
Тем не менее именно у ARC-AGI-2 сейчас, вероятно, самый большой разрыв между продвинутым ИИ и обычным человеком среди всех бенчмарков — а значит, это чувствительный индикатор продвижения к AGI. К тому же ARC развивается: Шолле допускает, что модели сравняются с людьми на текущей версии через год-два, и уже работает над ARC-AGI-3. Там каждая задача будет напоминать миниатюрную видеоигру, в которой игроку предстоит самому понять, какие понятия существенны, какие действия доступны и в чём вообще состоит цель.
Что вообще должен проверять тест на AGI
Исследователи выпускают всё новые бенчмарки, каждый из которых прощупывает свою грань универсального интеллекта. И каждый заодно показывает, насколько неполна наша карта этой территории.
Есть у любых публичных тестов и общая техническая беда — загрязнение обучающей выборки. Как только задачи и ответы попадают в открытый доступ, они рано или поздно оказываются в данных, на которых учат следующее поколение моделей, и высокий балл начинает означать не понимание, а запоминание. Именно поэтому организаторы всё чаще держат закрытые наборы заданий, ограничивают число попыток и вводят лимиты на вычисления — без этих мер сравнивать модели между собой попросту бессмысленно.
Одна из недавних работ представила General-Bench — тест, использующий пять входных модальностей (текст, изображения, видео, аудио и 3D) на сотнях задач, которые требуют распознавания, рассуждения, творчества, этических суждений и других способностей как понимать, так и порождать материал. В идеале AGI должен демонстрировать синергию, то есть переносить умения между задачами и обыгрывать узкоспециализированные системы. Пока же ни одна модель не справляется даже со всеми пятью модальностями сразу.
Другие бенчмарки строятся на виртуальных мирах. Апрельская статья в Nature описывает Dreamer — универсальный алгоритм Google DeepMind, который научился выполнять более 150 задач: играть в игры Atari, управлять виртуальными роботами и добывать алмазы в Minecraft. Всё это требует восприятия, исследования среды, долгосрочного планирования и взаимодействия, но неясно, как алгоритм повёл бы себя в неаккуратной реальности. Управлять персонажем игры проще, чем настоящим роботом, отмечает ведущий автор работы Данияр Хафнер: «Персонаж никогда не падает лицом вниз». Кроме того, в таких задачах нет ни богатого общения с людьми, ни понимания языка в связке с жестами и обстановкой. «Вы должны иметь возможность сказать домашнему роботу: „Убери посуду вон в тот шкаф, а не туда“ — и показать пальцем, а он поймёт», — говорит он. Команда работает над тем, чтобы симуляции и задачи стали ближе к реальным.
Помимо существующих тестов, специалисты давно спорят, как выглядела бы идеальная демонстрация. Ещё в 1970 году пионер ИИ Марвин Мински заявлял, что «через три-восемь лет у нас будет машина с общим интеллектом среднего человека» — способная читать Шекспира, смазать автомобиль, поучаствовать в офисных интригах, рассказать анекдот и подраться. Как набор задач это неплохая отправная точка — если бы кто-то сумел формализовать офисные интриги.
В статье 2024 года в журнале Engineering предложен тест Тонг (tong по-китайски — «общий»). Виртуальным персонажам выдаются случайно сгенерированные задания, проверяющие не только понимание, но и ценности: ИИ может неожиданно наткнуться на деньги на полу или на плачущего младенца, и исследователи наблюдают, что он станет делать. Авторы настаивают, что бенчмарк должен проверять способность системы исследовать среду и самостоятельно ставить цели, её согласованность с человеческими ценностями, понимание причинности и умение управлять виртуальным или физическим телом. Более того, тест должен уметь порождать бесконечное число заданий с динамическими физическими и социальными взаимодействиями.
Другие, вслед за Мински, предлагают испытания, требующие разной степени погружения в реальный мир: сварить кофе на незнакомой кухне, превратить сто тысяч долларов в миллион, поступить в университет и получить диплом. Беда в том, что часть таких проверок непрактична и способна нанести реальный вред. Заработать миллион ИИ может, например, обманув людей, — и тест окажется пройден совсем не тем способом, на который рассчитывали.
Нобелевский лауреат Джеффри Хинтон на вопрос о том, какие навыки дадутся ИИ труднее всего, отвечает так: «Раньше я думал, что это вещи вроде понимания, о чём думают другие люди, но кое-что из этого он уже умеет. Он уже способен обманывать». В недавнем межуниверситетском исследовании языковая модель убеждала испытуемых выбрать неверный ответ успешнее, чем это делали люди. Нынешний ответ Хинтона — сантехника: работа в старом доме требует залезать в неудобные щели и закручивать всё правильным образом, и это, по его оценке, будет безопасно для человека ещё лет десять.
Спорным остаётся и вопрос, обязательна ли физическая ловкость для AGI. В работе Google DeepMind об уровнях AGI утверждается, что нет: интеллект может проявляться и в чистом софте, а действия в физическом мире — это дополнение, а не обязательное условие.
Сама рамка «уровней» здесь важнее конкретного вердикта. Пока AGI обсуждают как бинарный порог — наступил или не наступил, — спор неразрешим, потому что каждая сторона подставляет своё определение. Шкала уровней переводит разговор в более практичную плоскость: не «разумна ли система», а на каком классе задач и с какой надёжностью она заменяет человека. Для регуляторов и корпоративных закупок это куда более рабочая постановка вопроса.
Митчелл из Института Санта-Фе считает, что проверять надо способность выполнять работу целиком. ИИ справляется со многими задачами врача-радиолога, но заменить его не может: в профессию входит масса дел, которых сам радиолог за собой не замечает, — решить, какие задачи вообще нужно решать, и разобраться с непредвиденными проблемами. «В мире есть такой длинный хвост того, что может случиться», — говорит она. Некоторые роботы-пылесосы не были обучены распознавать собачьи экскременты и размазывали их по ковру. Подобных мелочей проектировщик умной системы обычно не предусматривает.
Ещё одна школа мысли предлагает смотреть не только на результат, но и на внутреннее устройство. В недавней работе, соавтором которой стал Джефф Клун, специалист по компьютерным наукам из Университета Британской Колумбии, показано, что глубокое обучение часто приводит системы к «расколотым спутанным представлениям» — по сути, к связке наспех сшитых обходных приёмов. Человек же ищет в мире широкие и экономные закономерности. Модель может выглядеть разумной по одному тесту, но, если её внутренности неизвестны, легко получить сюрприз при развёртывании в новой обстановке, когда система применит неверное правило.
AGI уже наступил — и не наступит никогда
У Льюиса Кэрролла есть персонаж, пользовавшийся картой страны «в масштабе миля на милю», а затем перешедший к тому, чтобы использовать саму страну в качестве собственной карты. С тестированием интеллекта та же логика: самая точная «карта» поведения испытуемого в некоторой ситуации — это сама ситуация. В этом духе сильной проверкой AGI была бы, скажем, роботизированная система, прожившая полноценную человеческую жизнь и вырастившая ребёнка до взрослого возраста.
«В конечном счёте настоящая проверка возможностей ИИ — это то, что он делает в реальном мире, — говорит Клун. — Поэтому вместо бенчмарков я предпочитаю смотреть, какие научные открытия они совершают и какие рабочие места автоматизируют. Если людей нанимают меньше, а этот выбор не пересматривают, это крайне показательно». Но иногда нужно понять способности системы до того, как поручать ей чью-то работу.
Практический вывод из всей этой дискуссии для тех, кто выбирает инструменты, а не пишет статьи: смотреть стоит не на громкие заявления о приближении AGI, а на три вещи — на каком именно наборе задач измерялась модель, был ли этот набор закрытым и сколько вычислений ушло на результат. Модель, которая берёт планку за 20 тысяч долларов на одну задачу, и модель, которая делает то же самое за копейки, формально стоят в одной строке таблицы, но в проде это совершенно разные истории.
Не исключено, что договориться о том, что такое AGI или «человекоподобный» ИИ и что считать доказательством, так и не удастся. Машины будут ошибаться и дальше, а люди — указывать на эти ошибки как на признак «ненастоящего» интеллекта. Иванова из Технологического института Джорджии вспоминает недавнюю панельную дискуссию, где модератор спросил о сроках наступления AGI: один участник ответил, что этого может не случиться никогда, другой — что это уже произошло. Так что «AGI» удобен как краткое обозначение цели или страха, но его практическая ценность ограничена. В большинстве случаев рядом с этим термином стоит ставить звёздочку — и указывать конкретный бенчмарк.









