Согласно прогнозам консалтинговой компании Gartner к 2028 году расходы на кодинг с использованием LLM превысят среднюю зарплату разработчика в связи с огромным ростом потребления токенов и повсеместным переходом к оплате, основанной на объёме потребления.
AI‑токены — это единицы данных, которые обрабатываются генеративными моделями. Потребление токенов напрямую влияет на стоимость инструментов разработки с использованием LLM, особенно при использовании подписок с тарификацией на основе фактического потребления.
Организации быстро переходят от экспериментов к масштабному внедрению использования AI‑агентов, но многие недооценивают влияния растущего потребления токенов на бюджет. Дисциплина при расходовании токенов не появится у разработчиков сама по себе, так как обычно разработчики стараются оптимизировать скорость и удобство [разработки], а не эффективность затрат. Без управляемой операционной модели в программной инженерии расходы могут расти быстрее чем продуктивность, которую такие инструмент должны привносить.
Нитиш Тьяги
Старший главный аналитик в Gartner
Ценообразование на основе потребления создаёт сложности с предсказуемостью затрат
Переход от подписок с оплатой за рабочее место к подпискам с оплатой на основе потребления среди вендоров приводит к крайне непредсказуемой структуре издержек при разработке программного обеспечения. Ценообразование подписок было непрозрачным в плане учёта потребления токенов, что ограничивает возможности предприятий точно прогнозировать и контролировать будущие расходы [после смены модели оплаты].
Без чёткого представления об использовании токенов во всех задачах разработки организации рискуют столкнуться с перерасходом бюджета и снижением способности отслеживать результаты по отношению создаваемой ценности к её цене.
Большинству организаций всё ещё не хватает зрелости и фреймворков для эффективного измерения затрат и влияния на бизнес. Руководители в области программной инженерии всё больше обеспокоены, поскольку расход на токены становится всё сложнее объяснить руководству и акционерам, а бюджеты часто заканчиваются раньше, чем это ожидалось.
Модели потребления и пробелы в управлении усиливают давление на расходы
Помимо проблем с ценообразованием и прозрачностью, именно способы использования AI‑агентов дополнительно усиливают давление на расходы организаций. Перерасход токенов часто связан с тем, как руководители команд разработки управляют их использованием: типичные ошибки включают неограниченную автономию агентов в рабочих процессах, раздутые контекстные окна и отсутствие структурированных механизмов обратной связи для оптимизации использования.
Кроме того поставщики LLM всё ещё не предоставили зрелую встроенную оптимизацию расходов в агенты для разработки, провоцируя тем самым рост расходов.
Расходы на разработку с использованием LLM будут продолжать расти, поскольку инвестиции в инфраструктуру и проблемы с прибыльностью повышают цены на модели. В то же время, по мере того как всё больше разработчиков внедряют AI‑инструменты, ожидается что начинающие пользователи быстро станут массовыми активными пользователями по мере появления привычки и роста зависимости, что приведёт к ещё большему потреблению токенов и росту затрат.
Чтобы управлять растущими затратами и избегать перерасхода бюджета Gartner рекомендует руководителям команд разработки повышать дисциплину использования LLM:
-
Организуйте фреймворк принятия решений на основе сценариев использования: организациям следует ясно объявить, когда вообще следует использовать AI‑агентов и определить уместные уровни автономности агентов для каждого типа задач. Это включает в себя классификацию задач разработчиков по трём моделям: задачи без использования LLM, задачи с использованием LLM и задачи, которые полностью передаются AI‑агентам в работу;
-
Сопоставьте выбор модели со сложностью задачи: LLM наиболее эффективны, когда работа разбита на более мелкие задачи, которые могут выполнять небольшие недорогие модели, а эскалация до уровня более дорогой модели происходит только при необходимости при росте уровня сложности. Команды, отвечающие за разработку и инфраструктуру, должны внедрять интеллектуальные стратегии маршрутизации запросов к LLM, направляя простые и часто повторяющиеся задачи к небольшим и недорогим моделям, резервируя передовые LLM для сложной и высокоценной разработки;
-
Внедрите практики управления контекстом: разработчики должны быть обучены оптимизировать использование входного контекста для LLM таким образом, чтобы туда включалась только релевантная информация, содержимое обобщалось по возможности и удалялись все ненужные данные для того, чтобы снизить потребление токенов без снижения качества результатов на выходе;
-
Реализуйте управление и контроль за расходами: организациям следует внедрить такие механизмы как лимиты на токены, политики случаев использования более мощных LLM и автоматизированный мониторинг использования. Встраивание этих контролей в рабочие процессы обеспечивает единообразие и предотвращает неконтролируемый рост затрат;
-
Встройте ревью использования токенов в цикл разработки: следует обязать руководителей проводить регулярные разборы инцидентов повышенного потребления токенов, как часть рабочего спринта в рамках ретроспективы, чтобы идентифицировать неэффективность, совершенствовать практики использования LLM и стимулировать обмен знаниями между инженерными командами.
Настоящий материал является переводом пресс‑релиза Gartner за авторством Sonika Choubey.
Источник: habr.com