Идея звучит заманчиво: скачать открытую модель, развернуть у себя и забыть о счетах от API. Первое демо и правда собирается за пару часов — pip install, веса, файл на вход, готово. Но демо — не продакшн. Вопрос не в цене весов, а в том, сколько будет стоить поддерживать этот сервис в ближайшие два года.
Что вы покупаете, когда платите за API
Открытая модель распознавания речи — это только ядро будущего сервиса. Человек, который платит за управляемый API, закрывает целый пласт задач: инфраструктура для инференса, шумоподавление, диаризация, форматирование сущностей, стриминг и ночные дежурства. Вытаскивая модель из репозитория, вы автоматически берёте на себя всю эту обвязку. И это не всегда дешевле.
Возьмём простую арифметику из сравнительного анализа AssemblyAI. GPU-сервер уровня A100 или H100 в аренду обходится в $2–4 за час — и вы платите за каждый час, даже если GPU простаивает на 85%. Если средняя загрузка далека от максимума, деньги утекают впустую. Управляемый API, напротив, тарифицирует фактически обработанные секунды аудио: примерно $0.15–$0.21 за час аудио для асинхронной транскрипции и $0.15–$0.45 для стриминга. Разница в цене — на порядок.
Сравнение в числах
| Параметр | Self-hosted (Whisper, Parakeet, Voxtral) | Управляемый API (AssemblyAI) |
|---|---|---|
| Стоимость модели | $0 — открытые веса, без лицензии | $0 для старта, далее оплата по использованию |
| Что реально оплачивается | Часы GPU (включая простой) + время инженеров | Только фактически обработанное аудио, посекундно |
| Типичные операционные расходы | $2–4+/час за GPU A100/H100, независимо от загрузки | $0.15–$0.21/час асинхронно, $0.15–$0.45/час стриминг |
| Диаризация (кто и когда говорит) | Нужно строить самому или подключать отдельную модель | Встроена, транскрипт и спикеры формируются одновременно |
| Стриминг в реальном времени | Нужно самостоятельно разрабатывать низколатентный сервис | Готовый API, промежуточная транскрипция примерно за 300 мс |
Скрытые расходы, которых нет в цене весов
Диаризация и стриминг
Открытые модели почти никогда не умеют диаризацию из коробки. Вы получаете один поток текста без разбивки по говорящим. Для интервью, созвонов, колл-центров без разметки спикеров — бесполезно. Придётся добавить отдельную модель, а её качество на коротких репликах и пересекающихся голосах часто оставляет желать лучшего. Это самый хрупкий компонент всей системы.
Стриминг — та же история. Большинство открытых чекпоинтов работают в асинхронном режиме. Чтобы сделать голосового ассистента или субтитры в реальном времени, вам нужно самостоятельно решать задачу нарезки аудио, работы с частичными гипотезами и определения конца фразы. Это несколько недель работы опытного инженера.
Точность на повседневном аудио
Самое недооценённое — форматирование сущностей. Номера карт, email, коды подтверждения. Начитанный по буквам код — настоящий стресс-тест для распознавателя. Одна ошибка в символе делает транскрипт бесполезным. Сырая модель выдаёт слова, но не понимает, где нужно перевести "двадцать один" в "21", а где продиктовать "AB-123". Эту логику придётся писать и поддерживать самостоятельно.
Хуже того, на реальных записях — шум в машине, перебивающие друг друга голоса, профессиональный жаргон — модель начинает галлюцинировать. Система уверенно выдаёт связный текст, который не имеет к реальности никакого отношения. В опубликованных тестах AssemblyAI их флагманская модель показала примерно на 30% меньше галлюцинаций, чем Whisper. Это данные самого вендора, так что относиться к ним стоит скептически, но направление показательно. Пример с Voxtral Mini: почти 18% ошибок на аудио со смешением языков против менее 8% у управляемой флагманской модели.
Кто берёт трубку в 2 часа ночи
Вечером вы запускаете один запрос на одной GPU. В проде всё иначе: конкурентная нагрузка, ретраи, обновления без даунтайма, мониторинг аптайма. Каждый инцидент — это чей-то ночной звонок. У управляемого провайдера надёжность — это продукт, он обслуживает сотни миллионов обращений в месяц. У вас — просто ещё одна обязанность в списке задач.
Когда self-hosted действительно правильный выбор
Всё вышесказанное не значит, что собственная инфраструктура — всегда плохая идея. Есть несколько случаев, когда она экономически оправдана. Если вы делаете R&D-прототип и нужен полный контроль над моделью — берите и экспериментируйте. Если у вас постоянный конвейер офлайн-обработки больших объёмов, когда GPU можно загрузить на 100% и задержка не критична — экономика переворачивается в вашу пользу. И наконец, если законодательство или корпоративная политика запрещает выгружать аудио во внешние сервисы — self-hosted остаётся единственным вариантом.
Как принять решение по деньгам
Не сравнивайте цену весов и цену API. Сравнивайте полную стоимость владения: аренда GPU, время инженеров, система оценки качества, ночные дежурства. И прежде чем выбрать, прогоните оба варианта на своих самых сложных записях — с шумом, акцентами, специфичной лексикой. Именно этот тест даст ответ, что выгоднее, а не таблица на сайте вендора.
Если после подсчёта всех скрытых расходов self-hosted всё ещё кажется привлекательным — действуйте. Но честно ответьте себе на вопрос, кто будет поддерживать систему. Потому что самая дорогая часть — это не GPU. Это люди, которые будут разбираться с падающим сервисом в два часа ночи.
Комментарии (0)
Войдите, чтобы комментировать.
Пока нет комментариев. Будьте первым.