Слогер Создать блог
AI

Как сравнить LLM для работы с длинными документами: опыт с Kimi K2.5, Llama 3.3 70B и DeepSeek V3.2

Воспроизводимый бенчмарк на Oxlo.ai: от синтетического инцидент-репорта до автоматической оценки джадж-моделью.

Выбор большой языковой модели для работы с длинными документами — это компромисс между точностью, полнотой и аккуратностью. Рекламные формулировки не помогают: нужен воспроизводимый тест. Я собрал стенд на Oxlo.ai, прогнал через него три модели — Kimi K2.5, Llama 3.3 70B и DeepSeek V3.2 — и получил результаты, которыми можно руководствоваться при выборе.

Зачем это вообще нужно

Модели с длинным контекстом уже не редкость, но в реальных задачах важно не просто читать много текста, а извлекать из него суть. Например, при разборе инцидента специалист должен найти первопричину, оценить последствия, восстановить таймлайн и понять, какие действия предпринять. Ошибка здесь дорого стоит. Поэтому сравнение моделей на такой задаче — не абстрактное упражнение, а практическая необходимость.

Как устроен стенд

Идея простая: генерируется синтетический инцидент-репорт, состоящий из тысячи повторяющихся сегментов. В каждом сегменте описаны архитектура системы, сбой, обнаружение, митигация и пост-инцидентный анализ. Репорт подаётся модели вместе с системным промптом, который требует строго четыре раздела: Root Cause, Impact, Timeline, Action Items. Ответы оцениваются другой моделью — джаджем — по трём критериям: точность, полнота, лаконичность.

Почему синтетический? Чтобы каждый мог запустить тест у себя и получить сравнимые результаты. Внешние данные с изменяющимся содержанием мешают изоляции эксперимента.

Какие модели участвуют

  • Kimi K2.5 — делает упор на цепочку рассуждений (chain-of-thought).
  • Llama 3.3 70B — универсальная модель среднего размера.
  • DeepSeek V3.2 — известна хорошими результатами в рассуждениях и коде.

Все три запускались через единый API-клиент, совместимый с OpenAI.

Результаты одного запуска

Замерялась длина ответа и ставились баллы от 1 до 10. Вот как это выглядело:

МодельДлина ответаТочностьПолнотаЛаконичностьКомментарий джаджа
Kimi K2.5847 символов998Верно определил пропущенный индекс, чистый таймлайн
Llama 3.3 70B623 символа879Пропустила деталь про фейловер на синхронную реплику
DeepSeek V3.2912 символов9106Всё охватил, но добавил комментарии вне разделов

Цифры получены в одном конкретном запуске и при повторении будут немного другими. Но соотношение показательно.

Что значат оценки

У каждой модели свой характер. DeepSeek V3.2 вытащил максимум деталей, но не смог удержаться в рамках жёсткого формата. Llama 3.3 70B — самая короткая, но при пропуске важной детали её лаконичность перестаёт быть преимуществом. Kimi K2.5 занимает середину: хорошая точность, высокая полнота и без воды.

Вывод такой: лучшей модели нет. Есть модель, подходящая под вашу задачу. Если вам нужен максимально полный разбор и вы готовы почистить вывод — берите DeepSeek. Если критичен формат и каждая буква на счету — смотрите в сторону Kimi или Llama.

Как повторить эксперимент

Вам понадобятся Python 3.10+, библиотека openai и API-ключ Oxlo.ai. Стенд делает четыре шага:

  1. Создаёт синтетический документ в памяти — тысяча сегментов с описанием инцидента.
  2. Устанавливает единый системный промпт для всех моделей.
  3. Отправляет запрос каждой модели, замеряя длину ответа.
  4. Передаёт три ответа джадж-модели с требованием вернуть JSON-оценки.

Код небольшой, а запуск всего стенда обходится дёшево: Oxlo.ai берёт плату за запрос, а не за токены, поэтому длинный контекст не разоряет бюджет.

Типичные ошибки

  • Первый промпт для одной модели, второй — для другой. Сравнение становится бессмысленным.
  • Оценка ответов вручную. Вы быстро устанете, а джадж даёт ещё и объективный балл.
  • Игнор формата: модель может вернуть markdown вместо JSON — парсинг сломается, если не проверить.
  • Слишком короткий тестовый документ. Пока не загрузишь модель по-настоящему длинным текстом, не проверишь её контекстные способности.
  • Одна итерация. Результаты шумят, нужно несколько запусков и усреднение.

Когда этот подход не сработает

Если вы сравниваете модели на коротких запросах или на задачах, где важна креативность, критерии точности и полноты не дадут полезной информации. Также рассмотренный стенд не оценивает speed-to-first-token и другие параметры, критичные для интерактивных приложений.

Итог

Собрать свой бенчмарк для длинных документов — реально за пару часов. Описанный стенд даёт воспроизводимую отправную точку: он помогает отсеять модели, которые не тянут ваш сценарий, и выбрать ту, что попадает в требования по качеству и формату. А плоская цена Oxlo.ai позволяет расширять матрицу сравнения без роста стоимости.

По материалам: ai. Текст переработан редакцией Слогера.

← На главную

Рекламное место — Конец поста
Реклама · Слогер

Комментарии (0)

Войдите, чтобы комментировать.

Пока нет комментариев. Будьте первым.