Слогер Создать блог
AI

Голос в рабочий стол: 58 секунд от идеи до готового пространства

Inithouse замерила 847 голосовых сессий в Voice Tables и выяснила, на что на самом деле уходит время после того, как вы сказали фразу.

Мы в Inithouse запустили Voice Tables — рабочее пространство, которым управляешь голосом. Описываешь, что нужно: CRM, трекер, склад, — и оно само собирает таблицы, документы и данные. Хотели проверить гипотезу: голосовой ввод может обойти ручную настройку на порядок. Данные говорят, что может, но распределение времени удивило.

За четыре недели мы записали 847 голосовых сессий и разобрали, куда уходят секунды. Медианное время от сказанной фразы до готового рабочего пространства — 58 секунд. Это не предел — но внутри всё оказалось не так, как мы ожидали.

Куда уходят 58 секунд

Мы инструментировали весь конвейер. Каждая голосовая сессия записывала время на пяти контрольных точках: конец захвата аудио, завершение транскрибации, генерация схемы, наполнение данными, отрисовка интерфейса.

ЭтапМедианное времяДоля от общего
Захват аудио (пользователь говорит)8,2 с14%
Транскрибация (Whisper)4,1 с7%
Генерация схемы (LLM)22,4 с39%
Наполнение данными18,7 с32%
Отрисовка рабочего пространства4,6 с8%
Итого58,0 с100%

Генерация схемы — самый жирный кусок. LLM приходится угадывать типы колонок, связи между таблицами и значения по умолчанию из одного устного описания. Это куда сложнее, чем распознавание речи. Whisper справляется за 5 секунд даже на длинных запросах (до 30 слов), а вот дальнейшее обдумывание требует в 4–5 раз больше времени.

Какие запросы дают результат

Не каждый голосовой ввод превращается в рабочий инструмент. Из 847 сессий 714 (84%) создали рабочее пространство, которое пользователь оставил. Остальные 133 закономерно провалились.

Конкретные существительные рулят. «Мне нужна CRM для моих клиентов-сантехников» — работает. «Мне нужно как-то организовать вещи» — нет. Если в запросе есть конкретный объект (клиент, счёт, недвижимость, рецепт), успех достигает 91%. Без него — падает до 62%.

Длина не так важна, как конкретика. Мы думали, что длинные запросы дадут лучший результат, — но нет. Пять слов с чётким существительным («отслеживай мои фриланс-счета») дают 89% успеха. Двадцать слов вроде «хочу систему, где можно всё организовать и для работы, и для жизни» — только 58%.

Числа в запросе улучшают схему. Когда пользователь говорит «пять колонок» или «три категории», или «десять пунктов», схема совпадает с ожиданиями в 94% случаев. Без чисел точность падает до 76%. Мы не ожидали, что числа окажутся настолько сильным структурным сигналом, но модель воспринимает их как жёсткие ограничения.

Настоящее узкое место — не транскрибация

Перед замерами мы были уверены, что главный тормоз — распознавание речи. Whisper работает с акцентами, шумом, качеством микрофона. А генерация схемы — «всего лишь» текстовый запрос к LLM.

Данные перевернули это предположение. Транскрибация быстрая и надёжная (ошибка менее 3% в чистом помещении). А вся двусмысленность упирается в схему. Фраза «мои проекты» может означать канбан-доску, учёт счетов или блокнот для исследований. LLM выбирает один вариант, и иногда — не тот.

Мы попробовали два способа исправить ситуацию:

  1. Уточняющие вопросы. Когда уверенность LLM падает ниже 0,7, Voice Tables задаёт дополнительный вопрос перед генерацией схемы. Это добавляет около 6 секунд к таким сессиям (их ~22%), зато удержание в когорте с уточнениями выросло с 84% до 89%.
  2. Шаблоны. Для десяти самых частых сценариев (CRM, склад, бюджет, канбан, планировщик и др.) мы сделали готовые схемы. Если голосовый запрос совпадает с известной категорией (косинусная близость выше 0,85), срабатывает шаблон — без свободной генерации. Такие сессии выполняются за 34 секунды в медиане — на 41% быстрее общей медианы.

Что это значит для голосовых инструментов

Конвейер «голос → данные» — реальность. Voice Tables доказывает: от сказанного предложения до рабочего пространства меньше минуты. Но «меньше минуты» — не единый опыт. Разброс — от 28 секунд (шаблон + конкретный запрос) до 94 секунд (двусмысленный запрос с уточнениями).

В Inithouse мы параллельно делаем несколько продуктов: Ziva Fotka — анимация фото, Here We Ask — карточки для разговоров, Origin Of You — самопознание. И в каждом одно и то же: техническая задача первого порядка (распознавание речи, обработка изображений, моделирование личности) редко бывает бутылочным горлышком. Настоящий тормоз — интерпретационный слой, который превращает сырой ввод в структурированный результат.

Для голосовых инструментов конкретно: вкладывайтесь в генерацию схемы, а не в распознавание. Whisper или его аналоги — уже решённая задача потребительского уровня. А вот превращение сказанного намерения в структуру данных — всё ещё нет.

По материалам: productivity. Текст переработан редакцией Слогера.

← На главную

Рекламное место — Конец поста
Реклама · Слогер

Комментарии (0)

Войдите, чтобы комментировать.

Пока нет комментариев. Будьте первым.