Мы в Inithouse запустили Voice Tables — рабочее пространство, которым управляешь голосом. Описываешь, что нужно: CRM, трекер, склад, — и оно само собирает таблицы, документы и данные. Хотели проверить гипотезу: голосовой ввод может обойти ручную настройку на порядок. Данные говорят, что может, но распределение времени удивило.
За четыре недели мы записали 847 голосовых сессий и разобрали, куда уходят секунды. Медианное время от сказанной фразы до готового рабочего пространства — 58 секунд. Это не предел — но внутри всё оказалось не так, как мы ожидали.
Куда уходят 58 секунд
Мы инструментировали весь конвейер. Каждая голосовая сессия записывала время на пяти контрольных точках: конец захвата аудио, завершение транскрибации, генерация схемы, наполнение данными, отрисовка интерфейса.
| Этап | Медианное время | Доля от общего |
|---|---|---|
| Захват аудио (пользователь говорит) | 8,2 с | 14% |
| Транскрибация (Whisper) | 4,1 с | 7% |
| Генерация схемы (LLM) | 22,4 с | 39% |
| Наполнение данными | 18,7 с | 32% |
| Отрисовка рабочего пространства | 4,6 с | 8% |
| Итого | 58,0 с | 100% |
Генерация схемы — самый жирный кусок. LLM приходится угадывать типы колонок, связи между таблицами и значения по умолчанию из одного устного описания. Это куда сложнее, чем распознавание речи. Whisper справляется за 5 секунд даже на длинных запросах (до 30 слов), а вот дальнейшее обдумывание требует в 4–5 раз больше времени.
Какие запросы дают результат
Не каждый голосовой ввод превращается в рабочий инструмент. Из 847 сессий 714 (84%) создали рабочее пространство, которое пользователь оставил. Остальные 133 закономерно провалились.
Конкретные существительные рулят. «Мне нужна CRM для моих клиентов-сантехников» — работает. «Мне нужно как-то организовать вещи» — нет. Если в запросе есть конкретный объект (клиент, счёт, недвижимость, рецепт), успех достигает 91%. Без него — падает до 62%.
Длина не так важна, как конкретика. Мы думали, что длинные запросы дадут лучший результат, — но нет. Пять слов с чётким существительным («отслеживай мои фриланс-счета») дают 89% успеха. Двадцать слов вроде «хочу систему, где можно всё организовать и для работы, и для жизни» — только 58%.
Числа в запросе улучшают схему. Когда пользователь говорит «пять колонок» или «три категории», или «десять пунктов», схема совпадает с ожиданиями в 94% случаев. Без чисел точность падает до 76%. Мы не ожидали, что числа окажутся настолько сильным структурным сигналом, но модель воспринимает их как жёсткие ограничения.
Настоящее узкое место — не транскрибация
Перед замерами мы были уверены, что главный тормоз — распознавание речи. Whisper работает с акцентами, шумом, качеством микрофона. А генерация схемы — «всего лишь» текстовый запрос к LLM.
Данные перевернули это предположение. Транскрибация быстрая и надёжная (ошибка менее 3% в чистом помещении). А вся двусмысленность упирается в схему. Фраза «мои проекты» может означать канбан-доску, учёт счетов или блокнот для исследований. LLM выбирает один вариант, и иногда — не тот.
Мы попробовали два способа исправить ситуацию:
- Уточняющие вопросы. Когда уверенность LLM падает ниже 0,7, Voice Tables задаёт дополнительный вопрос перед генерацией схемы. Это добавляет около 6 секунд к таким сессиям (их ~22%), зато удержание в когорте с уточнениями выросло с 84% до 89%.
- Шаблоны. Для десяти самых частых сценариев (CRM, склад, бюджет, канбан, планировщик и др.) мы сделали готовые схемы. Если голосовый запрос совпадает с известной категорией (косинусная близость выше 0,85), срабатывает шаблон — без свободной генерации. Такие сессии выполняются за 34 секунды в медиане — на 41% быстрее общей медианы.
Что это значит для голосовых инструментов
Конвейер «голос → данные» — реальность. Voice Tables доказывает: от сказанного предложения до рабочего пространства меньше минуты. Но «меньше минуты» — не единый опыт. Разброс — от 28 секунд (шаблон + конкретный запрос) до 94 секунд (двусмысленный запрос с уточнениями).
В Inithouse мы параллельно делаем несколько продуктов: Ziva Fotka — анимация фото, Here We Ask — карточки для разговоров, Origin Of You — самопознание. И в каждом одно и то же: техническая задача первого порядка (распознавание речи, обработка изображений, моделирование личности) редко бывает бутылочным горлышком. Настоящий тормоз — интерпретационный слой, который превращает сырой ввод в структурированный результат.
Для голосовых инструментов конкретно: вкладывайтесь в генерацию схемы, а не в распознавание. Whisper или его аналоги — уже решённая задача потребительского уровня. А вот превращение сказанного намерения в структуру данных — всё ещё нет.
Комментарии (0)
Войдите, чтобы комментировать.
Пока нет комментариев. Будьте первым.