Слогер Создать блог
AI

Как ускорить инференс LLM на обычных GPU: разбор подхода Kog

Французский стартап Kog оптимизирует ПО для уже установленных GPU, обещая ускорение до 30 раз. Разбираем, что за этим стоит и когда это может пригодиться.

Если вы хоть раз ждали ответ от AI-агента дольше, чем хотелось бы, вы знаете, о чем речь. Французский стартап Kog предлагает решать проблему не покупкой новых чипов, а настройкой того, что уже стоит в дата-центре.

Почему обычные GPU считают неподходящими для агентных нагрузок

Распространенное мнение: стандартные GPU плохо подходят для инференса в агентных сценариях, где каждый запрос требует быстрой генерации. Kog считает это заблуждением. В мае компания показала демо на Hacker News: на стандартных центрах обработки данных — AMD MI300X и Nvidia H200 — удалось получить 3000 токенов в секунду на один запрос. Это та же аппаратура, что уже стоит у многих компаний.

Правда, есть нюанс. Модель была маленькая — Laneformer 2B, всего два миллиарда параметров. CEO Kog Гаэль Делалло признает: до больших моделей еще «большой скачок». Обещанное ускорение в 30 раз — пока не проверено на реальных масштабах. Но направление интересное.

Почему это важно для разработчика

Инференс — это деньги и скорость. Anthropic берет больше за Fast Mode для Claude, и это не случайность: быстрый ответ агента имеет прямую экономическую ценность. Kog после демо получил 200 конкретных бизнес-лидов. Первыми пользователями, скорее всего, станут инженеры, которые каждый день ждут, пока агент что-то выполнит. Плюс у Kog есть дизайн-партнер, где пользователи создают игры и приложения через промпты — там быстрее инференс напрямую означает выше выручка.

Kog не одинок. Другой французский проект — ZML — тоже делает софт для ускорения инференса, причем аппаратно-независимый: обходит CUDA от Nvidia и работает на разных чипах. Сам Делалло говорит, что Kog ближе к исследовательской лаборатории Hazy Research из Стэнфорда, чем к чистому коммерческому продукту.

Сравнение подходов: специализированный чип или оптимизация софта?

Если коротко: у каждого варианта свои компромиссы. Специализированные чипы вроде Cerebras обещают высокую производительность, но требуют новых вложений и не всегда совместимы с существующей инфраструктурой. Оптимизация ПО на текущем железе дешевле и быстрее в пилотировании, но пока не доказала себя на больших моделях.

КритерийСпециализированный чип (Cerebras)Оптимизация ПО (Kog)Обычный инференс без оптимизации
Что нужноПокупка нового оборудованияИспользование существующих GPUНичего дополнительно
СкоростьОчень высокая (заявлено)До 30x (заявлено, не подтверждено)Базовая
СовместимостьОграничена конкретным вендоромРаботает на AMD и NvidiaЛюбая
РискиВысокие инвестиции, вендор-локНе доказан на больших моделяхНет рисков, но нет и ускорения

Показательно, что Kog работает на той же архитектуре, что и многие дата-центры. Если подход подтвердится, это станет альтернативой покупке новых чипов — или хотя бы поводом отложить такие траты.

Что делать практикующему инженеру

Пока Kog не вышел за рамки демо, но из их истории можно вынести несколько полезных практик.

  • Профилируйте свой инференс. Часто узкое место не в GPU, а в неоптимальном коде — батчинге, квантизации, layout тензоров.
  • Попробуйте готовые оптимизации: TensorRT, vLLM, llama.cpp. Они уже дают прирост на стандартном железе.
  • Следите за проектами вроде Kog и ZML. Если они подтвердят ускорение на больших моделях, это изменит экономику инференса.
  • Считайте стоимость владения. Цена нового чипа — это не только его стоимость, но и интеграция, охлаждение, обслуживание. Оптимизация софта масштабируется иначе.

Подход Kog не подходит, если ваша модель уже работает быстро и вы упираетесь в другие ограничения — например, в память или сеть. Или если вы готовы платить за гарантированную производительность и не хотите ждать, пока софт дозреет.

Вывод

Главное в истории Kog — не число 30x (пока это маркетинг), а направление. Переиспользовать существующее железо вместо покупки нового — это тренд, который набирает силу. Следить за Kog стоит хотя бы потому, что они заставляют пересмотреть привычные расходы на инфраструктуру AI. А если их подход подтвердится — экономия будет значительной.

По материалам: dev. Текст переработан редакцией Слогера.

← На главную

Рекламное место — Конец поста
Реклама · Слогер

Комментарии (0)

Войдите, чтобы комментировать.

Пока нет комментариев. Будьте первым.