Способность точно оценивать вероятность будущих событий долгое время считалась областью, где лучшие люди заметно превосходят автоматизированные системы. Однако современные модели искусственного интеллекта быстро сокращают этот разрыв, а специализированные ИИ-прогнозисты в отдельных тестах уже достигают уровня наиболее успешных человеческих участников или даже превосходят их.
Одним из главных инструментов оценки таких систем стал ForecastBench — постоянно обновляемый тест, созданный Forecasting Research Institute. Вместо вопросов с заранее известными ответами он предлагает моделям прогнозировать реальные события, результат которых станет известен только в будущем. Это снижает риск того, что правильный ответ уже присутствовал в обучающих данных нейросети.
Вопросы охватывают экономику, геополитику, финансовые рынки, технологии и другие области. ИИ должен не просто выбрать один вариант, а указать вероятность события — например, оценить шансы на определенный уровень инфляции, изменение процентных ставок, результат выборов или достижение конкретного технологического показателя к установленной дате.
После наступления события прогнозы оцениваются с учетом того, насколько точно была определена вероятность. Такой подход позволяет отличать действительно хорошо откалиброванную систему от модели, которая просто часто выбирает наиболее очевидный вариант. В ForecastBench результаты также корректируются с учетом сложности разных вопросов, чтобы можно было сопоставлять прогнозистов, работавших с разными наборами заданий.
Особенно важным ориентиром являются так называемые суперпрогнозисты — небольшая группа людей, неоднократно демонстрировавших высокую точность в специализированных турнирах прогнозирования. Их преимущество обычно связывают не с доступом к уникальной информации, а со способностью постоянно обновлять оценки, учитывать базовые вероятности, искать альтернативные объяснения и избегать чрезмерной уверенности.
Еще несколько лет назад языковые модели заметно уступали таким людям. Теперь ситуация изменилась. По данным ForecastBench, ряд современных ИИ-систем уже статистически практически не отличается от суперпрогнозистов по общей точности, а на отдельных категориях вопросов способен показывать более высокие результаты.
Особенно хорошо ИИ справляется с задачами, для которых требуется быстро собрать большое количество открытых данных, определить исторические базовые показатели и сопоставить сразу несколько источников информации. В таких сценариях машина обладает естественным преимуществом: она способна анализировать значительно больший объем материала за гораздо меньшее время.
Более сложными остаются уникальные события, для которых исторических аналогов мало или вообще нет. Именно здесь особенно важны человеческое суждение, понимание политического и социального контекста и способность замечать факторы, плохо представленные в доступных данных. Тем не менее последние результаты показывают, что и в подобных заданиях разрыв между людьми и ИИ быстро сокращается.
Сравнивать результаты следует осторожно. Человеческие суперпрогнозисты и современные модели не всегда отвечали на одинаковые вопросы и не обязательно делали прогнозы в один и тот же период. Создатели ForecastBench используют статистические поправки на сложность заданий, однако такие методы не делают сравнение абсолютно прямым.
Существуют и другие системы оценки, результаты которых пока не показывают однозначного превосходства ИИ над лучшими людьми. На некоторых независимых площадках профессиональные прогнозисты по-прежнему заметно опережают модели. Различия объясняются наборами вопросов, методами подсчета баллов, доступом к внешним источникам и тем, насколько специализированной является конкретная ИИ-система.
Прогресс в этой области может иметь большое практическое значение. Более точные автоматизированные прогнозы потенциально пригодятся при планировании инвестиций, оценке экономических рисков, принятии корпоративных решений, анализе международных событий и подготовке государственных сценариев. ИИ при этом способен одновременно поддерживать тысячи прогнозов и регулярно обновлять их по мере появления новых данных.
Однако исследователи обращают внимание и на менее очевидный эффект. Сам процесс человеческого прогнозирования заставляет людей рассматривать противоположные аргументы, пересматривать собственную уверенность и обсуждать различные варианты развития событий. Если такую работу полностью передать алгоритмам, общество может получить более точные прогнозы, но потерять часть интеллектуальной пользы, возникающей непосредственно в процессе коллективного анализа.
Рост точности ИИ-прогнозистов поэтому не обязательно означает исчезновение человеческих экспертов. Более вероятным следующим этапом может стать сочетание двух подходов: искусственный интеллект будет быстро собирать данные, рассчитывать базовые вероятности и отслеживать изменения, а человек — оценивать контекст, необычные обстоятельства и последствия принимаемых решений.
