Не классифицируйте. Галлюцинируйте!¶
6.0/10
Контекст¶
Саймон Уиллесон столкнулся с задачей разметить старые записи в блоге, где уже собралось 1856 тегов. Прямая подсказка модели «выбери подходящие теги из этого огромного списка» непрактична: список слишком велик, чтобы целиком подать в один запрос.
Суть¶
Вместо того чтобы заставлять LLM классифицировать по фиксированному словарю, автор предлагает подход Дага Тёрнбалла: сначала попросить модель предложить новые, свободные метки, не ограничивая её существующим списком. Затем полученные кандидаты сопоставляются с ближайшими реальными тегами через векторные эмбеддинги корпуса. В примере промпта модели показывают образец типичных тегов, чтобы её «галлюцинации» были правдоподобными и походили на нужную структуру. Такой приём превращает неограниченную генерацию из помехи в инструмент: модель не обязана знать все 1856 вариантов, а эмбеддинги восстанавливают связь с контролируемым словарём. Автор делится идеей, а не законченным решением — в заметке нет кода, метрик и разбора ограничений.
Вывод¶
Главная мысль Уиллесона: классифицировать по огромному списку не нужно — стоит дать модели свободу галлюцинировать ярлыки и затем находить ближайшие реальные теги с помощью векторного поиска.