Слогер Создать блог
Разработка

Как проверять AI-модели и инструменты по публичным рейтингам: разбор трёх бордов

Публичные борды показывают разное: объём использования модели, живость репозитория или место продакта в карточной таблице. Разбираю, что каждый из них меряет и как читать такой рейтинг перед выбором.

Любой выбор инструмента — фреймворка, CLI-агента, расширения для IDE или кодинг-модели — упирается в один вопрос: чему верить. Страница вендора бодро рассказывает, что продукт умеет. Про то, что он встал на паузу полгода назад и в трекере висят неотвеченные issue, там не напишут. Публичные рейтинги эту дырку закрывают, но только когда за местом в таблице видно, откуда оно взялось.

Compound Labs держит три таких борда для разработчиков и продактов, и каждый измеряет своё. Ниже — что именно показывает каждый и как этим пользоваться, чтобы не купить красивую цифру.

ToolDrift: насколько модель реально используют

Борд ранжирует кодинг-модели по трём вещам: объём внутри отслеживаемых кодинг-инструментов, общий объём на OpenRouter и широта — сколько разных инструментов модель задействует. Плюс к этому разработчик получает цены, данные о роутинге и ленту изменений, которую сервис читает со страниц вендоров и из публичных репозиториев.

Ключевое слово здесь — «объём», а не «качество». Рейтинг отвечает на вопрос «что люди тащат в прод», а не «что правильно тащить в прод». Полезно и это: у популярной модели больше примеров в сети, быстрее отвечают в issues, и кто-то уже прошёл вашу интеграцию до вас.

Смотрите на широту отдельно от объёма. Модель с гигантской долей в одном инструменте и нулевой широтой — ставка одного вендора, которая исчезнет вместе с ним. Модель, которую тянут пять разных инструментов, переживёт уход любого из них.

StillShipping: жив ли инструмент

Здесь измеряется другое — движение. Борд читает свежесть коммитов, релизную активность, ответы в issue и другие сигналы репозитория, а на выходе выдаёт вердикт: мёртв, замедлился или поддерживается. Для выбора фреймворка, оркестратора, CLI-агента или расширения для IDE это самый прикладной из трёх.

Почему это вообще нужно. Агентский тулинг меняется быстрее, чем успевает осесть документация. Инструмент, который не двигался полгода, не обязательно плох — но разбираться с ним вы будете в одиночку, потому что сообщество уже ушло.

И да: борд публикует методику скоринга. Без неё вердикт «замедлился» не значит ничего, потому что порог замедления можно нарисовать какой угодно. Посмотрите, какие сигналы учитываются и с каким весом, прежде чем вычёркивать инструмент из шортлиста.

OutRip: рейтинг, в котором видно тягу

Третий продукт устроен иначе. Продакт вскрывает коллекционные паки с карточками, и рейтинг лучшей карточки определяет ваше место на публичном борде. Каждый пак возвращает в карточках как минимум свою стоимость покупки, а на борде видны и сами карточки, и позиция продукта.

Дело не в карточках. Это пример борда, где место в таблице нельзя просто заявить — его видно вместе с тем, что выпало.

Чем борды отличаются друг от друга

БордЧто ранжируетНа каких данныхКому полезенСлепая зона
ToolDriftКодинг-моделиОбъём внутри отслеживаемых кодинг-инструментов, объём на OpenRouter, широта по инструментамРазработчику, который выбирает модель под задачуНе говорит, какая модель пишет код лучше
StillShippingАгентские инструменты: фреймворки, оркестраторы, CLI-агенты, расширения IDEСвежесть коммитов, релизы, ответы в issue и другие сигналы репозиторияТому, кто решает, на чём строитьАктивность репозитория ещё не равна качеству кода
OutRipПродукты продактов — через карточкиВскрытые паки, где пак отдаёт минимум свою стоимость в карточкахПродакту, которому нужно место на бордеИгровая механика, а не техническая метрика

Как читать такой рейтинг перед решением

  1. Что меряется. Объём использования, активность репозитория или что-то третье. Формулировка «лучший» без уточнения метрики — маркетинг.
  2. Откуда данные. Публичные репозитории и отслеживаемые инструменты вызывают больше доверия, чем цифры, присланные самим вендором.
  3. Опубликована ли методика. Если формулу не показывают, вы не сможете понять, почему один инструмент обогнал другой, и не заметите, когда правила поменялись.
  4. Что борд не показывает. Ни один из трёх не скажет, подходит ли инструмент вашей команде, вашему стеку и вашему бюджету. Это по-прежнему ваша работа.

Типичные ошибки

  • Взять первую строку рейтинга как рекомендацию и не посмотреть на остальные.
  • Смотреть только на объём и игнорировать широту — так выбирают модель, которая держится на одном вендоре.
  • Пропустить цены и роутинг, которые ToolDrift отдаёт рядом с рейтингом. На вашем профиле нагрузки разница в стоимости может оказаться кратной.
  • Судить об инструменте по последнему релизу, не открывая ответы в issue: релиз бывает один, а вопросы висят месяцами.

Рабочая последовательность выглядит так. Сначала StillShipping — отсеять всё, что не двигалось. Потом ToolDrift — посмотреть, что используют на самом деле, сколько это стоит и какие есть варианты роутинга. Дальше один-два кандидата обкатать на своей задаче, потому что ни один публичный борд не знает ваших требований к latency, приватности и цене за токен.

Compound Labs описывает свою ленту так: продукты разбирают по частям несколько раз в неделю — что каждый делает, сколько стоило его построить, как устроен пайплайн и что показали цифры, снятые с репозитория и живого сайта.

Практический шаг на сегодня — небольшой. Откройте один из бордов, найдите в нём инструмент, который уже стоит у вас в стеке, и сверьте его вердикт с тем, что вы о нём думали. Расхождение и будет ответом на вопрос, нужны ли вам публичные рейтинги вообще.

По материалам: career. Текст переработан редакцией Слогера.

← На главную

Рекламное место — Конец поста
Реклама · Слогер

Комментарии (0)

Войдите, чтобы комментировать.

Пока нет комментариев. Будьте первым.