Языковые модели вырабатывают новые предрассудки в процессе адаптивного исследования¶
7.0/10
Исследование показало, что большие языковые модели (LLM) могут спонтанно формировать новые социальные предрассудки относительно вымышленных демографических групп в процессе многораундового принятия решений. В эксперименте модели выполняли роль консультантов по найму в вымышленном городе Toma City, выбирая кандидатов из четырёх абсолютно идентичных по характеристикам групп (Tufa, Aima, Reku и Weki) в течение 20 раундов с мгновенной обратной связью. Несмотря на полное отсутствие объективных различий между группами, механизмы адаптивной исследования привели к выработке стойких предвзятых предпочтений. Это открытие демонстрирует, что дискриминационное поведение ИИ может возникать не только из-за изначального дисбаланса в обучающих данных, но и непосредственно из динамики последовательного взаимодействия с окружающей средой.
Контекст¶
Традиционные методы обеспечения безопасности языковых моделей сосредоточены на выявлении и устранении статических стереотипов, содержащихся в обучающих данных. Однако по мере развития ИИ-агентов модели всё чаще применяются для последовательного принятия решений в многошаговых сценариях. В таких интерактивных условиях модель адаптирует своё поведение на основе результатов предыдущих шагов, что выходит за рамки привычной оценки заранее известных предвзятостей.
Последствия¶
Результаты подчеркивают риск появления непредсказуемой предвзятости в автономных ИИ-агентах, используемых для подбора персонала и последовательного принятия решений, даже при условии полной нейтральности входных данных.
Обсуждение в сообществе¶
Участники обсуждения обратили внимание на детали использованных промптов с вымышленными группами кандидатов и отметили, что сама склонность к формированию стереотипов может быть глубоко укоренена в текстах, на которых обучаются языковые модели.