Слогер Создать блог
AI

Прогнозирование ИИ: почему все ошибаются и как считать точнее

Прогнозы по ИИ не сбываются с завидной регулярностью. Это не случайность: методология прогнозирования даёт сбой в ключевых местах, а оптимисты и скептики ошибаются по-своему.

Прогнозирование — это методология. Она проверена на повторяющихся событиях с чистой обратной связью: на инфраструктурных проектах, клинических испытаниях, погоде. С искусственным интеллектом эта методология ломается почти по всем предпосылкам. И это не разговоры о «сложности» — можно точно указать, где именно ломается.

Референсный класс: тот самый якорь, которого нет

Серьёзный прогноз начинается с выбора референсного класса — набора похожих прошлых событий, которые дают базовую частоту. Как часто затягивают крупные инфраструктурные проекты? Сколько препаратов со второй фазы доходят до рынка? Базовая частота страхует от излишней самоуверенности. Для трансформативного ИИ каждый кандидат спорен, и каждый приводит к другому ответу.

Референсный класс Что он подсказывает Кто его обычно выбирает
Другое программное обеспечение Быстрое распространение, почти нулевые издержки, быстрый рост способностей Оптимисты, ожидающие быстрых перемен
Общие технологии (электричество, двигатель, компьютеры) Десятилетия разрыва между изобретением и ростом производительности Экономисты
Прошлые циклы ИИ Сначала завышенные обещания, потом спад Многолетние скептики
Смены эпох роста (сельское хозяйство, индустриализация) Редкие, быстрые, меняющие мир сдвиги Те, кто верит в радикальные скачки

Слабость «прошлых циклов» в том, что текущий цикл отличается от прежних: системы реально развёрнуты в промышленной эксплуатации, чего не было в 1970-х или 1980-х. А смены эпох — слишком редкий класс, выборка из нескольких единиц.

Нейтральной процедуры выбора между этими классами нет. А выбор почти полностью определяет итоговый прогноз. Когда двое спорят о сроках сильного ИИ, они почти всегда спорят о выборе референсного класса, а не о фактах про сам ИИ. Поэтому дискуссия редко сходится.

Взгляд изнутри и взгляд снаружи: оба не работают

Внешний взгляд — игнорировать детали, использовать базовую частоту. Это стандартное лекарство от завышенной уверенности. Здесь оно не работает, потому что согласованной базовой частоты нет.

Внутренний взгляд — моделировать механизм и оценивать каждый шаг. Тут другая беда: нужно знать, какие шаги остались. Если гипотеза масштабирования верна, дальше в основном ресурсы — и задача почти сводится к прогнозированию цепочек поставок. Если же не хватает таких способностей, как непрерывное обучение и моделирование мира, то остались неизвестные научные прорывы. А время прихода неизвестного прорыва не имеет распределения, которое кто-то умеет оценивать. Внутренний взгляд зависит от ответа на тот самый вопрос, который он должен решить.

То, что прогнозируют, постоянно меняет форму

Прогнозирование лучше всего работает, когда критерий результата фиксирован и внешний. У ИИ всё не так.

Бенчмарки насыщаются и заменяются. Когда все набирают почти максимум, метрика перестаёт различать, и сообщество переходит к более сложной. Получается не длинный временной ряд, а серия несопоставимых измерений. А именно длинные ряды нужны для экстраполяции.

Метрики загрязняются. Если бенчмарк публичный и модели обучаются на тексте из интернета, рост счёта частично отражает утечку данных, а не способность. Это измеримо и уже измерено — но отсюда следует, что высокий балл не значит высокую способность.

Обвязка меняет результат без изменения модели. Одни и те же веса работают совершенно по-разному с лучшим промптингом, доступом к инструментам, поиском или стратегией выборки. «Что умеет система?» — свойство не только модели. Сравнения через время — это сравнения движущихся связок, а не моделей.

Два типа ошибок: кто и как ошибается

Обе стороны представлены, и ни у одной нет монополии на строгость.

Переоценка

Характерный механизм — обобщение от демонстрации. Впечатляющий результат в контролируемых условиях принимают за способность в общем случае. А разрыв между ними — надёжность, краевые случаи, враждебные примеры, интеграция с системами — это и есть те самые годы. Родственная ошибка: экстраполяция кривой роста железа на вывод о способностях без промежуточных аргументов про алгоритмы и данные.

Недооценка

Характерный механизм — аргумент от текущего ограничения к вечному. Системы уже не раз получали способности, которые уверенные аргументы объявляли недостижимыми для этого подхода. Аргументы обычно имели одну форму: заметить, что текущий метод делает плохо, и объявить это структурным свойством метода, а не фактом его масштаба или обучения. Родственная ошибка — отмахиваться от свидетельств способности потому, что механизм не похож на человеческое познание. Это утверждение о механизме, отвечающее на вопрос о поведении.

Эти ошибки несимметричны по последствиям. Цена ошибки влияет на то, как действовать в условиях неопределённости, но не на вероятность события. Это часто подмешивают в эмпирический спор, хотя это вопрос про риск, а не про то, случится ли.

Что хорошие прогнозы делают иначе

  • Прогнозируйте вводные, а не исход. Объём вычислений, вложенный капитал, доступ к данным, эффективность алгоритмов — у них есть реальные временные ряды. Точные вводные не дают ответ, но неточные гарантируют ошибку.
  • Прогнозируйте способности, а не ярлыки. «Система, которая справится с конкретной многодневной задачей по разработке ПО без присмотра» — измеримо. «AGI» — нет.
  • Называйте распределение и то, что его сдвинет. Прогнозист, который говорит, какое наблюдение изменит его мнение, берёт на себя проверяемое обязательство. Тот, кто этого не делает, просто выражает отношение.
  • Фиксируйте собственный результат. Калибровка тренируется, измеряется правилами подсчёта вроде Brier score и специфична для домена. Тот, кто годами публично прогнозировал этот домен и получал оценки, — иной источник, чем эксперт по созданию систем.
  • Разделяйте разные прогнозы: о способностях, о внедрении, о влиянии на экономику. У них разные доказательные базы и разные лаги. Способность появилась — это не продукт вышел на рынок, продукт вышел — это ещё не изменившаяся экономика.

Прогнозирование ИИ не безнадёжно. Просто оно требует честности: фиксируйте свой референсный класс, различайте вводные и исход, называйте то, что может переубедить. И помните, что цена ошибки — не то же самое, что её вероятность.

По материалам: ai. Текст переработан редакцией Слогера.

← На главную

Рекламное место — Конец поста
Реклама · Слогер

Комментарии (0)

Войдите, чтобы комментировать.

Пока нет комментариев. Будьте первым.