Андрей Илькаев
Обсудить задачу EN

Главная / Словарь / Что такое инференс

Что такое инференс

Инференс - это работа уже обученной модели: вы отправили запрос, модель посчитала ответ. Обучение происходит один раз и стоит огромных денег, инференс происходит при каждом обращении и составляет всю вашу текущую стоимость. Когда обсуждают цену эксплуатации ИИ, речь идёт именно об инференсе.

От чего зависит стоимость инференса?

От модели и от объёма токенов на входе и выходе. Разница в цене между моделями бывает десятикратной, поэтому первый способ снизить расходы - не гонять тяжёлую модель там, где хватает лёгкой. Второй способ - сокращать промпт: всё, что можно отфильтровать кодом до модели, не должно доезжать до неё.

Что такое локальный инференс?

Запуск модели на своём оборудовании вместо обращения к облачному сервису. Плюс в том, что данные не покидают контур и стоимость запроса становится нулевой. Минус в том, что нужна видеокарта, а модели, помещающиеся на одну карту, заметно слабее облачных. Для разбора шаблонных документов этого хватает, для сложных рассуждений обычно нет.

Почему инференс бывает медленным?

Модель порождает ответ по одному токену за раз, и длинный ответ физически не может прийти мгновенно. Отсюда практический вывод для автоматизации: просить у модели короткий структурированный ответ выгоднее вдвойне, это и дешевле, и быстрее.

Термины по темеЧто такое LLM · Что такое токены в нейросети · Контекстное окно нейросети
Как это учитывается в работе: автоматизация с ИИ.

Обновлено: август 2026

Андрей Илькаев - маркетолог, строю маркетинговые системы и автоматизации. Обо мне · Все термины словаря · Telegram