Любой выбор инструмента — фреймворка, CLI-агента, расширения для IDE или кодинг-модели — упирается в один вопрос: чему верить. Страница вендора бодро рассказывает, что продукт умеет. Про то, что он встал на паузу полгода назад и в трекере висят неотвеченные issue, там не напишут. Публичные рейтинги эту дырку закрывают, но только когда за местом в таблице видно, откуда оно взялось.
Compound Labs держит три таких борда для разработчиков и продактов, и каждый измеряет своё. Ниже — что именно показывает каждый и как этим пользоваться, чтобы не купить красивую цифру.
ToolDrift: насколько модель реально используют
Борд ранжирует кодинг-модели по трём вещам: объём внутри отслеживаемых кодинг-инструментов, общий объём на OpenRouter и широта — сколько разных инструментов модель задействует. Плюс к этому разработчик получает цены, данные о роутинге и ленту изменений, которую сервис читает со страниц вендоров и из публичных репозиториев.
Ключевое слово здесь — «объём», а не «качество». Рейтинг отвечает на вопрос «что люди тащат в прод», а не «что правильно тащить в прод». Полезно и это: у популярной модели больше примеров в сети, быстрее отвечают в issues, и кто-то уже прошёл вашу интеграцию до вас.
Смотрите на широту отдельно от объёма. Модель с гигантской долей в одном инструменте и нулевой широтой — ставка одного вендора, которая исчезнет вместе с ним. Модель, которую тянут пять разных инструментов, переживёт уход любого из них.
StillShipping: жив ли инструмент
Здесь измеряется другое — движение. Борд читает свежесть коммитов, релизную активность, ответы в issue и другие сигналы репозитория, а на выходе выдаёт вердикт: мёртв, замедлился или поддерживается. Для выбора фреймворка, оркестратора, CLI-агента или расширения для IDE это самый прикладной из трёх.
Почему это вообще нужно. Агентский тулинг меняется быстрее, чем успевает осесть документация. Инструмент, который не двигался полгода, не обязательно плох — но разбираться с ним вы будете в одиночку, потому что сообщество уже ушло.
И да: борд публикует методику скоринга. Без неё вердикт «замедлился» не значит ничего, потому что порог замедления можно нарисовать какой угодно. Посмотрите, какие сигналы учитываются и с каким весом, прежде чем вычёркивать инструмент из шортлиста.
OutRip: рейтинг, в котором видно тягу
Третий продукт устроен иначе. Продакт вскрывает коллекционные паки с карточками, и рейтинг лучшей карточки определяет ваше место на публичном борде. Каждый пак возвращает в карточках как минимум свою стоимость покупки, а на борде видны и сами карточки, и позиция продукта.
Дело не в карточках. Это пример борда, где место в таблице нельзя просто заявить — его видно вместе с тем, что выпало.
Чем борды отличаются друг от друга
| Борд | Что ранжирует | На каких данных | Кому полезен | Слепая зона |
|---|---|---|---|---|
| ToolDrift | Кодинг-модели | Объём внутри отслеживаемых кодинг-инструментов, объём на OpenRouter, широта по инструментам | Разработчику, который выбирает модель под задачу | Не говорит, какая модель пишет код лучше |
| StillShipping | Агентские инструменты: фреймворки, оркестраторы, CLI-агенты, расширения IDE | Свежесть коммитов, релизы, ответы в issue и другие сигналы репозитория | Тому, кто решает, на чём строить | Активность репозитория ещё не равна качеству кода |
| OutRip | Продукты продактов — через карточки | Вскрытые паки, где пак отдаёт минимум свою стоимость в карточках | Продакту, которому нужно место на борде | Игровая механика, а не техническая метрика |
Как читать такой рейтинг перед решением
- Что меряется. Объём использования, активность репозитория или что-то третье. Формулировка «лучший» без уточнения метрики — маркетинг.
- Откуда данные. Публичные репозитории и отслеживаемые инструменты вызывают больше доверия, чем цифры, присланные самим вендором.
- Опубликована ли методика. Если формулу не показывают, вы не сможете понять, почему один инструмент обогнал другой, и не заметите, когда правила поменялись.
- Что борд не показывает. Ни один из трёх не скажет, подходит ли инструмент вашей команде, вашему стеку и вашему бюджету. Это по-прежнему ваша работа.
Типичные ошибки
- Взять первую строку рейтинга как рекомендацию и не посмотреть на остальные.
- Смотреть только на объём и игнорировать широту — так выбирают модель, которая держится на одном вендоре.
- Пропустить цены и роутинг, которые ToolDrift отдаёт рядом с рейтингом. На вашем профиле нагрузки разница в стоимости может оказаться кратной.
- Судить об инструменте по последнему релизу, не открывая ответы в issue: релиз бывает один, а вопросы висят месяцами.
Рабочая последовательность выглядит так. Сначала StillShipping — отсеять всё, что не двигалось. Потом ToolDrift — посмотреть, что используют на самом деле, сколько это стоит и какие есть варианты роутинга. Дальше один-два кандидата обкатать на своей задаче, потому что ни один публичный борд не знает ваших требований к latency, приватности и цене за токен.
Compound Labs описывает свою ленту так: продукты разбирают по частям несколько раз в неделю — что каждый делает, сколько стоило его построить, как устроен пайплайн и что показали цифры, снятые с репозитория и живого сайта.
Практический шаг на сегодня — небольшой. Откройте один из бордов, найдите в нём инструмент, который уже стоит у вас в стеке, и сверьте его вердикт с тем, что вы о нём думали. Расхождение и будет ответом на вопрос, нужны ли вам публичные рейтинги вообще.
Комментарии (0)
Войдите, чтобы комментировать.
Пока нет комментариев. Будьте первым.