Перейти к содержанию

Конвертация PDF в Markdown как источник высоких затрат на AI-токены

4.0/10

Контекст

Саймон Уиллинсон ссылается на материал 404 Media о том, что компании начинают беспокоиться из-за высоких расходов на AI-токены. В заметке его особенно зацепил анекдот из утечки совещания Accenture: значительную часть потребления токенов могут вызывать не инженеры, а неинженеры, использующие LLM для неэффективных задач.

Суть

По словам представителей Accenture, приведённым в статье, внутренняя компания показала, что одним из самых затратных сценариев стала конвертация PDF в изображения, а затем в Markdown. Уиллинсон не развивает эту мысль технически: в его записи нет оценки масштаба затрат, сравнения с альтернативами или предложений по оптимизации. Он использует эпизод как иллюстрацию более широкой проблемы — PDF остаётся плохим носителем информации для AI-обработки, а неинженерные сценарии использования могут незаметно раздувать расходы на токены.

Вывод

Автор сводит наблюдение к простой мысли: если Accenture осознает, что PDF — ужасный формат для передачи информации, возможно, эту идею удастся донести и до остального бизнес-мира.