Моделирование предпочтений человека с помощью ранжирования трёх вариантов вместо парных сравнений математически необходимо для выявления скрытых корреляций, существенного повышения точности алгоритмов рекомендаций и эффективного обучения ИИ.
Учёные из Массачусетского технологического института математически доказали, что классические парные сравнения «A против B» не способны выявить скрытые взаимосвязи в человеческом выборе. Добавление всего одной альтернативы кардинально меняет точность алгоритмов, позволяя создавать более эффективные рекомендательные системы и точнее обучать искусственный интеллект.
Почти столетняя фундаментальная проблема психометрии
В 1927 году американский психолог Луис Леон Терстоун заложил основы математического анализа человеческого поведения в своей работе «Закон сравнительного суждения». Учёный предложил оценивать скрытую ценность предметов или решений через их парное сопоставление, поскольку человеку психологически трудно присвоить абстрактному варианту точную числовую оценку. Гораздо проще ответить, что вы предпочитаете в конкретный момент: чашку кофе или чай.
Модели случайной полезности до сих пор остаются главным инструментом для прогнозирования решений людей во множестве сфер жизни. Их используют градостроители для расчёта нагрузки на дорожные сети при перекрытии улиц, маркетологи для оценки спроса на товары, а также разработчики онлайн-платформ для подбора фильмов или музыки. Более того, на этих же концепциях строится современное обучение ИИ-моделей с подкреплением на основе обратной связи от человека (RLHF), где нейросеть учится выбирать наиболее удачный ответ из предложенных вариантов.
Сравнение вариантов исключительно попарно математически блокирует возможность обнаружить взаимосвязи и зависимость между несколькими альтернативами. Профессор компьютерных наук MIT Константинос Даскалакис и его коллеги обратили внимание на то, что бинарный формат полностью упускает контекстные связи. Например, если человек одинаково часто выбирает кофе вместо чая и чай вместо горячего шоколада, алгоритм парных сравнений считает эти предпочтения независимыми и усредняет их.
Большинство классических алгоритмов вынуждено опираться на гипотезу о независимости от нерелевантных альтернатив. Это упрощение предполагает, что отношение человека к двум объектам не зависит от наличия третьего, что противоречит реальному устройству человеческой психики. В жизни наши решения тесно взаимосвязаны: предпочтение одного предмета может автоматически повышать или понижать ценность группы других похожих вариантов. Из-за этой слепой зоны привычные A/B-тесты и рекомендательные алгоритмы часто дают сбои, выдавая неподходящие советы.
Сила трёх как идеальный математический инструмент
Исследователи из MIT представили на международной конференции ICLR доказательство того, что ранжирование трёх вариантов одновременно полностью снимает проблему потери данных. Команда в составе Константиноса Даскалакиса, Габриэле Фарины, Собхана Мохаммадпура и Яшвандха Черанапамджери математически обосновала: данные формата «лучший из трёх» являются не просто полезными, а строго необходимыми и достаточными для восстановления коррелированных моделей предпочтений.
Переход от сопоставления двух элементов к ранжированию тройки открывает алгоритмам доступ к скрытой ковариации и связям между альтернативами. С точки зрения математической статистики, трёхточечное сравнение превращает несвязные двумерные проекции в полноценную многомерную карту человеческих интересов. В результате модели обучаются гораздо быстрее и требуют меньше вводных данных для построения точного прогноза поведения конкретного человека.
Опрос пользователей с помощью тройных сравнений создаёт более высокую когнитивную нагрузку на человека, чем простой клик по одному из двух вариантов. На практике людям требуется больше времени и внимания, чтобы упорядочить три объекта по степени привлекательности. Однако авторы исследования подчёркивают, что эту сложность компенсирует глубокое качество получаемой информации: небольшая выборка тройных ранжирований даёт гораздо больше пользы, чем миллионы поверхностных бинарных кликов.
Разработанный алгоритм открывает новые возможности для оптимизации городских сервисов и ИИ-платформ. Например, при проектировании маршрутов общественного транспорта в мегаполисах аналитики смогут точнее учитывать, как жители выбирают между метро, автобусом и каршерингом в зависимости от погоды и времени суток. В сфере разработки искусственного интеллекта новый подход позволит создавать более чуткие и персонализированные диалоговые ассистенты, которые лучше понимают сложные и противоречивые запросы пользователей.
Ключевые тезисы:
- Традиционные парные сравнения (A/B) не способны уловить статистическую взаимосвязь между множественными предпочтениями человека.
- Учёные MIT доказали, что выбор из трёх вариантов даёт минимально необходимый объем данных для построения точных многомерных моделей.
- Новый подход позволяет эффективнее обучать искусственный интеллект (RLHF) и улучшать городское планирование.
Поддержать нас на Boosty
Поддержать нас на Дзен
FAQ: Часто задаваемые вопросы
Почему традиционные A/B-тесты не всегда точно отражают желания людей?
Обычные A/B-тесты заставляют человека выбирать между двумя изолированными вариантами. При этом алгоритм не видит скрытых связей и контекста, из-за чего не может уловить, как появление третьей альтернативы изменило бы решение пользователя.
Как выбор из трёх вариантов улучшает обучение искусственного интеллекта?
При обучении ИИ методом RLHF человек оценивает ответы нейросети. Сравнение трёх ответов одновременно позволяет математической модели увидеть тонкие взаимосвязи в предпочтениях и точнее настроить систему под человеческие ценности.
В чём заключается главное отличие ранжирования тройки от парного сравнения?
Парное сравнение даёт только линейную информацию о том, что один объект лучше другого. Ранжирование трёх элементов позволяет алгоритму вычислить ковариацию — математическую зависимость между выбором разных категорий.
Сложнее ли человеку выбирать из трёх вариантов вместо двух?
Да, когнитивная нагрузка на респондента слегка возрастает, так как расставить три предмета по порядку требует большей концентрации. Однако высокое качество полученных данных позволяет использовать значительно меньшее количество опросов.
Источники:
- Cherapanamjeri Y., Daskalakis C., Farina G., Mohammadpour S. Learning Correlated Reward Models: Statistical Barriers and Opportunities. International Conference on Learning Representations (ICLR), 2026. [DOI/arXiv: arXiv:2606.11000]
- Nadis S. When it comes to predicting people’s preferences, it pays to consider “the power of three”. MIT News / Phys.org, June 2026.
- Thurstone L. L. A law of comparative judgment. Psychological Review, 34(4), 273–286, 1927.
Читайте также: Телескоп Уэбба опроверг предсказание темной материи
