Если вы хоть раз ждали ответ от AI-агента дольше, чем хотелось бы, вы знаете, о чем речь. Французский стартап Kog предлагает решать проблему не покупкой новых чипов, а настройкой того, что уже стоит в дата-центре.
Почему обычные GPU считают неподходящими для агентных нагрузок
Распространенное мнение: стандартные GPU плохо подходят для инференса в агентных сценариях, где каждый запрос требует быстрой генерации. Kog считает это заблуждением. В мае компания показала демо на Hacker News: на стандартных центрах обработки данных — AMD MI300X и Nvidia H200 — удалось получить 3000 токенов в секунду на один запрос. Это та же аппаратура, что уже стоит у многих компаний.
Правда, есть нюанс. Модель была маленькая — Laneformer 2B, всего два миллиарда параметров. CEO Kog Гаэль Делалло признает: до больших моделей еще «большой скачок». Обещанное ускорение в 30 раз — пока не проверено на реальных масштабах. Но направление интересное.
Почему это важно для разработчика
Инференс — это деньги и скорость. Anthropic берет больше за Fast Mode для Claude, и это не случайность: быстрый ответ агента имеет прямую экономическую ценность. Kog после демо получил 200 конкретных бизнес-лидов. Первыми пользователями, скорее всего, станут инженеры, которые каждый день ждут, пока агент что-то выполнит. Плюс у Kog есть дизайн-партнер, где пользователи создают игры и приложения через промпты — там быстрее инференс напрямую означает выше выручка.
Kog не одинок. Другой французский проект — ZML — тоже делает софт для ускорения инференса, причем аппаратно-независимый: обходит CUDA от Nvidia и работает на разных чипах. Сам Делалло говорит, что Kog ближе к исследовательской лаборатории Hazy Research из Стэнфорда, чем к чистому коммерческому продукту.
Сравнение подходов: специализированный чип или оптимизация софта?
Если коротко: у каждого варианта свои компромиссы. Специализированные чипы вроде Cerebras обещают высокую производительность, но требуют новых вложений и не всегда совместимы с существующей инфраструктурой. Оптимизация ПО на текущем железе дешевле и быстрее в пилотировании, но пока не доказала себя на больших моделях.
| Критерий | Специализированный чип (Cerebras) | Оптимизация ПО (Kog) | Обычный инференс без оптимизации |
|---|---|---|---|
| Что нужно | Покупка нового оборудования | Использование существующих GPU | Ничего дополнительно |
| Скорость | Очень высокая (заявлено) | До 30x (заявлено, не подтверждено) | Базовая |
| Совместимость | Ограничена конкретным вендором | Работает на AMD и Nvidia | Любая |
| Риски | Высокие инвестиции, вендор-лок | Не доказан на больших моделях | Нет рисков, но нет и ускорения |
Показательно, что Kog работает на той же архитектуре, что и многие дата-центры. Если подход подтвердится, это станет альтернативой покупке новых чипов — или хотя бы поводом отложить такие траты.
Что делать практикующему инженеру
Пока Kog не вышел за рамки демо, но из их истории можно вынести несколько полезных практик.
- Профилируйте свой инференс. Часто узкое место не в GPU, а в неоптимальном коде — батчинге, квантизации, layout тензоров.
- Попробуйте готовые оптимизации: TensorRT, vLLM, llama.cpp. Они уже дают прирост на стандартном железе.
- Следите за проектами вроде Kog и ZML. Если они подтвердят ускорение на больших моделях, это изменит экономику инференса.
- Считайте стоимость владения. Цена нового чипа — это не только его стоимость, но и интеграция, охлаждение, обслуживание. Оптимизация софта масштабируется иначе.
Подход Kog не подходит, если ваша модель уже работает быстро и вы упираетесь в другие ограничения — например, в память или сеть. Или если вы готовы платить за гарантированную производительность и не хотите ждать, пока софт дозреет.
Вывод
Главное в истории Kog — не число 30x (пока это маркетинг), а направление. Переиспользовать существующее железо вместо покупки нового — это тренд, который набирает силу. Следить за Kog стоит хотя бы потому, что они заставляют пересмотреть привычные расходы на инфраструктуру AI. А если их подход подтвердится — экономия будет значительной.
Комментарии (0)
Войдите, чтобы комментировать.
Пока нет комментариев. Будьте первым.