Главная / Словарь / Что такое инференс
Что такое инференс
Инференс - это работа уже обученной модели: вы отправили запрос, модель посчитала ответ. Обучение происходит один раз и стоит огромных денег, инференс происходит при каждом обращении и составляет всю вашу текущую стоимость. Когда обсуждают цену эксплуатации ИИ, речь идёт именно об инференсе.
От чего зависит стоимость инференса?
От модели и от объёма токенов на входе и выходе. Разница в цене между моделями бывает десятикратной, поэтому первый способ снизить расходы - не гонять тяжёлую модель там, где хватает лёгкой. Второй способ - сокращать промпт: всё, что можно отфильтровать кодом до модели, не должно доезжать до неё.
Что такое локальный инференс?
Запуск модели на своём оборудовании вместо обращения к облачному сервису. Плюс в том, что данные не покидают контур и стоимость запроса становится нулевой. Минус в том, что нужна видеокарта, а модели, помещающиеся на одну карту, заметно слабее облачных. Для разбора шаблонных документов этого хватает, для сложных рассуждений обычно нет.
Почему инференс бывает медленным?
Модель порождает ответ по одному токену за раз, и длинный ответ физически не может прийти мгновенно. Отсюда практический вывод для автоматизации: просить у модели короткий структурированный ответ выгоднее вдвойне, это и дешевле, и быстрее.