Слогер Создать блог
AI

Почему self-hosted Whisper может выйти дороже готового API: разбор реальной стоимости

Бесплатно скачать веса — не значит бесплатно поддерживать сервис. Разбираем GPU, ночные дежурства, диаризацию и точность — всё, что не входит в цену модели.

Идея звучит заманчиво: скачать открытую модель, развернуть у себя и забыть о счетах от API. Первое демо и правда собирается за пару часов — pip install, веса, файл на вход, готово. Но демо — не продакшн. Вопрос не в цене весов, а в том, сколько будет стоить поддерживать этот сервис в ближайшие два года.

Что вы покупаете, когда платите за API

Открытая модель распознавания речи — это только ядро будущего сервиса. Человек, который платит за управляемый API, закрывает целый пласт задач: инфраструктура для инференса, шумоподавление, диаризация, форматирование сущностей, стриминг и ночные дежурства. Вытаскивая модель из репозитория, вы автоматически берёте на себя всю эту обвязку. И это не всегда дешевле.

Возьмём простую арифметику из сравнительного анализа AssemblyAI. GPU-сервер уровня A100 или H100 в аренду обходится в $2–4 за час — и вы платите за каждый час, даже если GPU простаивает на 85%. Если средняя загрузка далека от максимума, деньги утекают впустую. Управляемый API, напротив, тарифицирует фактически обработанные секунды аудио: примерно $0.15–$0.21 за час аудио для асинхронной транскрипции и $0.15–$0.45 для стриминга. Разница в цене — на порядок.

Сравнение в числах

Параметр Self-hosted (Whisper, Parakeet, Voxtral) Управляемый API (AssemblyAI)
Стоимость модели $0 — открытые веса, без лицензии $0 для старта, далее оплата по использованию
Что реально оплачивается Часы GPU (включая простой) + время инженеров Только фактически обработанное аудио, посекундно
Типичные операционные расходы $2–4+/час за GPU A100/H100, независимо от загрузки $0.15–$0.21/час асинхронно, $0.15–$0.45/час стриминг
Диаризация (кто и когда говорит) Нужно строить самому или подключать отдельную модель Встроена, транскрипт и спикеры формируются одновременно
Стриминг в реальном времени Нужно самостоятельно разрабатывать низколатентный сервис Готовый API, промежуточная транскрипция примерно за 300 мс

Скрытые расходы, которых нет в цене весов

Диаризация и стриминг

Открытые модели почти никогда не умеют диаризацию из коробки. Вы получаете один поток текста без разбивки по говорящим. Для интервью, созвонов, колл-центров без разметки спикеров — бесполезно. Придётся добавить отдельную модель, а её качество на коротких репликах и пересекающихся голосах часто оставляет желать лучшего. Это самый хрупкий компонент всей системы.

Стриминг — та же история. Большинство открытых чекпоинтов работают в асинхронном режиме. Чтобы сделать голосового ассистента или субтитры в реальном времени, вам нужно самостоятельно решать задачу нарезки аудио, работы с частичными гипотезами и определения конца фразы. Это несколько недель работы опытного инженера.

Точность на повседневном аудио

Самое недооценённое — форматирование сущностей. Номера карт, email, коды подтверждения. Начитанный по буквам код — настоящий стресс-тест для распознавателя. Одна ошибка в символе делает транскрипт бесполезным. Сырая модель выдаёт слова, но не понимает, где нужно перевести "двадцать один" в "21", а где продиктовать "AB-123". Эту логику придётся писать и поддерживать самостоятельно.

Хуже того, на реальных записях — шум в машине, перебивающие друг друга голоса, профессиональный жаргон — модель начинает галлюцинировать. Система уверенно выдаёт связный текст, который не имеет к реальности никакого отношения. В опубликованных тестах AssemblyAI их флагманская модель показала примерно на 30% меньше галлюцинаций, чем Whisper. Это данные самого вендора, так что относиться к ним стоит скептически, но направление показательно. Пример с Voxtral Mini: почти 18% ошибок на аудио со смешением языков против менее 8% у управляемой флагманской модели.

Кто берёт трубку в 2 часа ночи

Вечером вы запускаете один запрос на одной GPU. В проде всё иначе: конкурентная нагрузка, ретраи, обновления без даунтайма, мониторинг аптайма. Каждый инцидент — это чей-то ночной звонок. У управляемого провайдера надёжность — это продукт, он обслуживает сотни миллионов обращений в месяц. У вас — просто ещё одна обязанность в списке задач.

Когда self-hosted действительно правильный выбор

Всё вышесказанное не значит, что собственная инфраструктура — всегда плохая идея. Есть несколько случаев, когда она экономически оправдана. Если вы делаете R&D-прототип и нужен полный контроль над моделью — берите и экспериментируйте. Если у вас постоянный конвейер офлайн-обработки больших объёмов, когда GPU можно загрузить на 100% и задержка не критична — экономика переворачивается в вашу пользу. И наконец, если законодательство или корпоративная политика запрещает выгружать аудио во внешние сервисы — self-hosted остаётся единственным вариантом.

Как принять решение по деньгам

Не сравнивайте цену весов и цену API. Сравнивайте полную стоимость владения: аренда GPU, время инженеров, система оценки качества, ночные дежурства. И прежде чем выбрать, прогоните оба варианта на своих самых сложных записях — с шумом, акцентами, специфичной лексикой. Именно этот тест даст ответ, что выгоднее, а не таблица на сайте вендора.

Если после подсчёта всех скрытых расходов self-hosted всё ещё кажется привлекательным — действуйте. Но честно ответьте себе на вопрос, кто будет поддерживать систему. Потому что самая дорогая часть — это не GPU. Это люди, которые будут разбираться с падающим сервисом в два часа ночи.

По материалам: dev. Текст переработан редакцией Слогера.

← На главную

Рекламное место — Конец поста
Реклама · Слогер

Комментарии (0)

Войдите, чтобы комментировать.

Пока нет комментариев. Будьте первым.