Перейти к содержанию

Не классифицируйте. Галлюцинируйте!

6.0/10

Контекст

Саймон Уиллесон столкнулся с задачей разметить старые записи в блоге, где уже собралось 1856 тегов. Прямая подсказка модели «выбери подходящие теги из этого огромного списка» непрактична: список слишком велик, чтобы целиком подать в один запрос.

Суть

Вместо того чтобы заставлять LLM классифицировать по фиксированному словарю, автор предлагает подход Дага Тёрнбалла: сначала попросить модель предложить новые, свободные метки, не ограничивая её существующим списком. Затем полученные кандидаты сопоставляются с ближайшими реальными тегами через векторные эмбеддинги корпуса. В примере промпта модели показывают образец типичных тегов, чтобы её «галлюцинации» были правдоподобными и походили на нужную структуру. Такой приём превращает неограниченную генерацию из помехи в инструмент: модель не обязана знать все 1856 вариантов, а эмбеддинги восстанавливают связь с контролируемым словарём. Автор делится идеей, а не законченным решением — в заметке нет кода, метрик и разбора ограничений.

Вывод

Главная мысль Уиллесона: классифицировать по огромному списку не нужно — стоит дать модели свободу галлюцинировать ярлыки и затем находить ближайшие реальные теги с помощью векторного поиска.