Слогер Создать блог
AI

Как ускорить инференс LLM на обычных GPU: разбор подхода Kog

Французский стартап Kog оптимизирует ПО для уже установленных GPU, обещая ускорение до 30 раз. Разбираем, что за этим стоит и когда это может пригодиться.

Если вы хоть раз ждали ответ от AI-агента дольше, чем хотелось бы, вы знаете, о чем речь. Французский стартап Kog предлагает решать проблему не покупкой новых чипов, а настройкой того, что уже стоит в дата-центре.

Почему обычные GPU считают неподходящими для агентных нагрузок

Распространенное мнение: стандартные GPU плохо подходят для инференса в агентных сценариях, где каждый запрос требует быстрой генерации. Kog считает это заблуждением. В мае компания показала демо на Hacker News: на стандартных центрах обработки данных — AMD MI300X и Nvidia H200 — удалось получить 3000 токенов в секунду на один запрос. Это та же аппаратура, что уже стоит у многих компаний.

Правда, есть нюанс. Модель была маленькая — Laneformer 2B, всего два миллиарда параметров. CEO Kog Гаэль Делалло признает: до больших моделей еще «большой скачок». Обещанное ускорение в 30 раз — пока не проверено на реальных масштабах. Но направление интересное.

Почему это важно для разработчика

Инференс — это деньги и скорость. Anthropic берет больше за Fast Mode для Claude, и это не случайность: быстрый ответ агента имеет прямую экономическую ценность. Kog после демо получил 200 конкретных бизнес-лидов. Первыми пользователями, скорее всего, станут инженеры, которые каждый день ждут, пока агент что-то выполнит. Плюс у Kog есть дизайн-партнер, где пользователи создают игры и приложения через промпты — там быстрее инференс напрямую означает выше выручка.

Kog не одинок. Другой французский проект — ZML — тоже делает софт для ускорения инференса, причем аппаратно-независимый: обходит CUDA от Nvidia и работает на разных чипах. Сам Делалло говорит, что Kog ближе к исследовательской лаборатории Hazy Research из Стэнфорда, чем к чистому коммерческому продукту.

Сравнение подходов: специализированный чип или оптимизация софта?

Если коротко: у каждого варианта свои компромиссы. Специализированные чипы вроде Cerebras обещают высокую производительность, но требуют новых вложений и не всегда совместимы с существующей инфраструктурой. Оптимизация ПО на текущем железе дешевле и быстрее в пилотировании, но пока не доказала себя на больших моделях.

КритерийСпециализированный чип (Cerebras)Оптимизация ПО (Kog)Обычный инференс без оптимизации
Что нужноПокупка нового оборудованияИспользование существующих GPUНичего дополнительно
СкоростьОчень высокая (заявлено)До 30x (заявлено, не подтверждено)Базовая
СовместимостьОграничена конкретным вендоромРаботает на AMD и NvidiaЛюбая
РискиВысокие инвестиции, вендор-локНе доказан на больших моделяхНет рисков, но нет и ускорения

Показательно, что Kog работает на той же архитектуре, что и многие дата-центры. Если подход подтвердится, это станет альтернативой покупке новых чипов — или хотя бы поводом отложить такие траты.

Что делать практикующему инженеру

Пока Kog не вышел за рамки демо, но из их истории можно вынести несколько полезных практик.

  • Профилируйте свой инференс. Часто узкое место не в GPU, а в неоптимальном коде — батчинге, квантизации, layout тензоров.
  • Попробуйте готовые оптимизации: TensorRT, vLLM, llama.cpp. Они уже дают прирост на стандартном железе.
  • Следите за проектами вроде Kog и ZML. Если они подтвердят ускорение на больших моделях, это изменит экономику инференса.
  • Считайте стоимость владения. Цена нового чипа — это не только его стоимость, но и интеграция, охлаждение, обслуживание. Оптимизация софта масштабируется иначе.

Подход Kog не подходит, если ваша модель уже работает быстро и вы упираетесь в другие ограничения — например, в память или сеть. Или если вы готовы платить за гарантированную производительность и не хотите ждать, пока софт дозреет.

Вывод

Главное в истории Kog — не число 30x (пока это маркетинг), а направление. Переиспользовать существующее железо вместо покупки нового — это тренд, который набирает силу. Следить за Kog стоит хотя бы потому, что они заставляют пересмотреть привычные расходы на инфраструктуру AI. А если их подход подтвердится — экономия будет значительной.

По материалам: dev. Текст переработан редакцией Слогера.

← На главную

Рекламное место — Конец поста
Реклама · Слогер

Комментарии (1)

Войдите, чтобы комментировать.

Leia Mcclure 12.09.2026 22:15 ▲ 0
Интересный разбор. Мне кажется, главный вопрос действительно не в заявленных «30x», а в том, насколько хорошо такой подход покажет себя на реальных больших моделях и в production. Если оптимизация ПО действительно позволит значительно ускорить инференс на уже существующих GPU, это может быть гораздо выгоднее, чем постоянно покупать новое специализированное оборудование. Будет интересно увидеть независимые тесты и сравнение стоимости на практике.
Маркетинг

Как писать рассылки для клиентов на бесплатных инструментах: разбор рабочего процесса

Один ретейнер на $450 в месяц за восемь выпусков в год показал: услуга по написанию email-рассылок держится не на платных сервисах, а на голосе бренда и редакторской дисциплине. Разбираю стек, процесс, цены и типичные провалы.

Слогер 29.09.2026 ▲ 0
Карьера

Разбор: как устроен рынок Gmail-аккаунтов на продажу и почему покупка почти всегда убыточна

Свежие, PVA и aged-аккаунты продают за 1–5 долларов, обещая мгновенный старт и полную конфиденциальность. Разбираем, что скрывается за этими объявлениями, где тут риск и какие есть легальные способы получить нужное количество ящиков.

Слогер 29.09.2026 ▲ 1
Разработка

Почему «сколько кода я написал» — плохая метрика: как оценивать себя как программиста

Считать строки и гордиться тем, что всё написано из памяти, — привычка, которая мешает доводить проекты до конца. Разбираю, какие вопросы о своём коде стоит задавать вместо этого.

Слогер 29.09.2026 ▲ 0
Разработка

Как получать деньги через GitHub Sponsors: выплаты, налоги и частые ошибки

Sponsors не превратился в новую платёжную систему — изменилась обвязка вокруг выплат: налоги, фискальные хосты и биллинг. Разбираем, что нужно настроить до того, как профиль станет публичным.

Слогер 29.09.2026 ▲ 0
Fluxs lenta
Реклама · fluxs.ru
Разработка

Электронный документооборот в Fluxs: как договор перестаёт теряться между кабинетами

Во вторник договор ушёл юристу. В четверг клиент спрашивает, когда подпишем. Юрист говорит, что давно отдал в бухгалтерию. Бухгалтерия ничего не получала. В пятницу вечером договор находится — в почте у финансового директора, который в отпуске. Никто не ленился. Просто у документа не было маршрута. Мы сделали в Fluxs модуль «Документооборот». Коротко, что в нём есть: — маршрут согласования рисуется схемой: параллельные ветки, условие «если сумма больше миллиона — к финдиректору»; — сроки в рабочих часах, напоминания, передача руководителю при просрочке; — подпись кодом из письма или КЭП через КриптоПро прямо в браузере; — клиент согласует договор по ссылке, без регистрации; — ознакомление с приказами без листа с подписями. И отдельно про безопасность: если кто-то поправит решение или подпись прямо в базе, это будет видно в карточке документа. Модуль бесплатный с тарифа «Бизнес». Как

Слогер 28.09.2026 ▲ 0
Карьера

Как зарабатывать на переводе и локализации без диплома: разбор воркфлоу на бесплатных инструментах

Процесс, который позволяет брать $340 за один заказ и превращать разовые сделки в ежемесячные ретейнеры — без дорогого софта и профильного образования.

Слогер 28.09.2026 ▲ 0
Образование

Как проверить старые соцсети перед визой и учёбой за рубежом: 6 категорий и порядок действий

Аккаунты — единственный пункт в списке документов, который нельзя восстановить задним числом. Разбираем, что искать в собственных постах и почему удаление поста — лишь первый шаг.

Слогер 28.09.2026 ▲ 0
Карьера

Чистка цифрового следа перед собеседованием: график на 6 недель и что уже поздно начинать

Рекрутеры чаще гуглят кандидата не на этапе отклика, а когда он уже в шортлисте. Отсюда и запас времени, и жёсткий дедлайн — разбираем обратный отсчёт по неделям.

Слогер 28.09.2026 ▲ 0
Fluxs lenta
Реклама · fluxs.ru
Образование

Как учиться сложным вещам: система, где знания проверяются действием, а не перечитыванием

Пять приёмов из практики преподавания и self-learning в кибербезопасности: карта вместо первой страницы, worked examples, извлечение из памяти, интервалы и цикл «сломал — починил — объяснил».

Слогер 28.09.2026 ▲ 0
Карьера

Как подготовиться к собеседованию по кодингу: 7 книг и порядок, в котором их читать

Провал на интервью редко связан с тем, что вы не умеете программировать. Чаще не хватает системы, словаря для разговора о дизайне и практики объяснять решение вслух — и всё это можно закрыть книгами.

Слогер 27.09.2026 ▲ 0
Карьера

Как откликаться на вакансии без диплома: разбор фильтра, который отсеивает за две минуты

Junior-вакансия с Python, SQL и автоматизацией, три документа от кандидата — и отказ через 120 секунд после отправки. Разбираем, что здесь происходит и как проходить такие воронки, если диплома нет.

Слогер 27.09.2026 ▲ 0
Fluxs lenta
Реклама · fluxs.ru