Конвертация PDF в Markdown как источник высоких затрат на AI-токены¶
4.0/10
Контекст¶
Саймон Уиллинсон ссылается на материал 404 Media о том, что компании начинают беспокоиться из-за высоких расходов на AI-токены. В заметке его особенно зацепил анекдот из утечки совещания Accenture: значительную часть потребления токенов могут вызывать не инженеры, а неинженеры, использующие LLM для неэффективных задач.
Суть¶
По словам представителей Accenture, приведённым в статье, внутренняя компания показала, что одним из самых затратных сценариев стала конвертация PDF в изображения, а затем в Markdown. Уиллинсон не развивает эту мысль технически: в его записи нет оценки масштаба затрат, сравнения с альтернативами или предложений по оптимизации. Он использует эпизод как иллюстрацию более широкой проблемы — PDF остаётся плохим носителем информации для AI-обработки, а неинженерные сценарии использования могут незаметно раздувать расходы на токены.
Вывод¶
Автор сводит наблюдение к простой мысли: если Accenture осознает, что PDF — ужасный формат для передачи информации, возможно, эту идею удастся донести и до остального бизнес-мира.