Слогер Создать блог
AI

Что такое RAG и как он работает: разбор восьми шагов для тех, кто не пишет код

RAG звучит как что-то из докладов для разработчиков, но объясняется за пять минут. Разбираем весь путь от вопроса к ответу — с архивом, секретарём и петлями, которые обычно не рисуют на схемах.

Внутренний ассистент получает вопрос: «Какая у нас политика возвратов для корпоративных клиентов?» Через пару секунд выдаёт ответ и ссылку на сам документ. Выглядит так, будто модель знала. Она не знала. Её обучали задолго до того, как этот документ появился, и доступа к вашим файлам у неё нет.

Всё, что происходит между вопросом и ответом, называется RAG — Retrieval-Augmented Generation. Идея проще, чем аббревиатура: сначала найти нужный кусок текста, потом попросить модель ответить по нему. А восемь шагов ниже — это то, как такую идею обычно собирают руками.

Метафора, которая держит всю схему

Руководитель ставит задачу. Секретарь идёт в архив, достаёт папки, отсеивает лишнее и приносит готовый ответ со ссылкой на источник. Все восемь шагов — про это. Если держать в голове секретаря, дальше читается без словаря.

Восемь шагов: от вопроса до ответа со ссылкой

  1. Приём вопроса. Система берёт текст, который ввёл пользователь.
  2. Эмбеддинг и осмысление. Вопрос чистят: расплывчатые формулировки переписывают, добавляют синонимы, сложный вопрос разбивают на несколько простых. Затем превращают в вектор — строку чисел, чтобы компьютер мог сравнить смысл вопроса с содержимым базы.
  3. Поиск. По вектору ищут самые близкие по смыслу фрагменты. В рабочей системе это воронка от широкого к узкому: параллельно работают два канала — поиск по смыслу и поиск по буквальному совпадению слов. Потом отсекают то, что показывать нельзя: нет доступа, версия устарела. Остатки пересортировывает более внимательная модель — это называют реранкингом.
  4. Сборка промпта. Найденное, исходный вопрос и инструкции по поведению системы складывают в один текст. Слово Augmented в названии ровно про этот момент: найденным материалом дополняют ваш вопрос.
  5. Генерация. Модель читает папку и выдаёт ответ слово за словом.
  6. Ограждения. Проверка на утечку закрытых данных, сломанное форматирование, явную выдумку. По-английски — guardrails. В системах посложнее модель сверяет свой ответ с найденными документами и переписывает при расхождении; этот самоанализ называют reflection.
  7. Ответ со ссылками. Вместе с текстом приходит указание, на каком документе и каком фрагменте он основан.
  8. Логирование. Обмен сохраняют, обычно в двух видах. Лог — постоянная запись для отладки, аудита и статистики. История диалога — контекст для следующего вопроса. Задачи разные, лежат часто в разных местах.

То, что произошло задолго до вашего вопроса

Откуда вообще взялись векторы в базе, по которой ищет шаг третий? Это отдельный конвейер, работающий постоянно и вне восьми шагов, — офлайн-индексация. «Офлайн» здесь значит: не в момент ответа, а заранее.

Цепочка такая: документ → парсинг (PDF и Word читают в простой текст) → чанкинг (длинный документ режут на куски, скажем, по несколько сотен символов: модель не может прочитать всё сразу, а по длинным кускам точный поиск хуже) → эмбеддинг каждого куска → запись в векторную базу.

Это архивная рутина: папки разложили по темам заранее, чтобы потом доставать по требованию. Без неё каждый вопрос пришлось бы начинать с перерывания всей документации компании — unbearably долго и дорого. И это не работа «сделал и забыл»: новые документы, правки, смена стратегии поиска запускают обновление или перестройку индекса.

Прямая это линия? Четыре петли

На одном гладком обмене репликами восемь шагов действительно идут по прямой, и порядок не переставить. Но у реальной системы есть ответвления, которые включаются при определённых условиях.

Петля A · Искать заново. Ещё до генерации выясняется, что найденного материала для ответа не хватает. Тогда вопрос переформулируют и возвращаются к шагам 2–3 за новым раундом поиска — иногда несколько раз подряд. Ключевое: число раундов не зашито в код заранее, модель решает на месте. Это и есть агентный режим работы.

Петля B · Отказ на проверке. Если не прошёл шаг 6, система откатывается к генерации или к поиску по заранее прописанным правилам. Здесь, в отличие от петли A, всё решено до запуска: при каких условиях возвращаться, куда именно и сколько попыток максимум.

Петля C · Многоходовый диалог. Своей памяти у модели нет: раунд закончился — она ничего не помнит. То, что вы можете уточнить «а для второго тарифа?», обеспечивает шаг 8: вопрос и ответ попадают в историю диалога (именно в историю, а не в лог). При следующем вопросе шаг 4 подкладывает эту историю в общую папку вместе с новым вопросом и свежим материалом, и модель перечитывает всё заново. Коротко: вывод прошлого раунда становится частью входа следующего.

Петля D · Логи возвращаются в работу. Накопленные записи периодически уходят в систему оценки: какие вопросы отвечаются плохо и что виновато — поиск или генерация. По результатам инженеры правят чанкинг и стратегию поиска, после чего перестраивают офлайн-индекс. Цикл идёт днями и неделями, и решения тут принимают люди, а не система.

Три поколения RAG — и главный вопрос: кто решает

Деление на три поколения взялось из обзора 2023 года; третье там называлось Modular RAG, но прижилось другое слово — Agentic RAG, оно точнее описывает сдвиг.

ПоколениеЧто меняетсяПетли и кто ими управляет
Naive RAGВосемь шагов идут напрямую, каждый в самой простой версииПетли прописаны в коде инженерами
Advanced RAGСкелет тот же, но шаги отточены: переформулировка и разложение вопроса на шаге 2, воронка «широко → узко» на шаге 3, reflection и повторные попытки на шаге 6Правила в коде и решения людей; история диалога пришивается фиксированно
Agentic RAGМодель сама решает, искать ли ещё, как переформулировать и стоит ли доверять своему ответуПраво на решение у модели, на лету

Компоненты во всех трёх поколениях одни и те же. Меняется ответ на вопрос, кто отдаёт команды. Как только решение о повторе поиска или о качестве ответа передают модели, петля становится агентной — и поколение вместе с ней.

Что с этим делать на практике

Если вы заказчик, а не разработчик, проверять систему удобно вопросами.

  • Спросите про документ, которого заведомо не было в момент обучения модели. Система без RAG начнёт сочинять, система с RAG — искать.
  • Спросите про документ, к которому у вас нет доступа. Он не должен всплыть ни в ответе, ни в цитате.
  • Возьмите любую ссылку из ответа, откройте первоисточник и сверьте формулировку. Цитаты существуют ровно для этого.
  • Уточните: «а если договор продлевается автоматически?» Так проверяется петля C — пришивается ли история диалога.
  • Попросите устаревшую версию регламента. Если она всё ещё в индексе, значит, перестройку индекса никто не настроил.

Типичные ошибки при сборке встречаются одни и те же. Резать документы фиксированными кусками, не глядя на структуру — заголовок отдельно, таблица отдельно, смысл потерян. Искать только по смыслу, без канала буквальных совпадений — точные номера, артикулы и аббревиатуры находятся плохо. Отдавать ответ без ссылок — проверить нечего, доверие держится на вере. Не вести логи — тогда петля D не работает, и качество никуда не движется.

Подход хорошо ложится на корпоративные базы знаний, регламенты, поддержку и всё, что меняется и требует проверяемого источника. Он плохо подходит там, где ответ надо собирать рассуждением по всей базе сразу или где документов нет вовсе.

Сама схема выглядит громоздко только на бумаге. В основе — знакомая офисная логика: найти нужное, отдать тому, кто напишет, проверить и сохранить след. Всё остальное — надстройки над этим.

По материалам: career. Текст переработан редакцией Слогера.

← На главную

Рекламное место — Конец поста
Реклама · Слогер

Комментарии (0)

Войдите, чтобы комментировать.

Пока нет комментариев. Будьте первым.

Карьера

Как выбраться из выгорания разработчику: 6 книг с рабочими инструментами

Выгорание — это не просто усталость, а пропавший интерес, спад продуктивности и вера в то, что ты разучился писать код. Разбираем шесть книг, которые дают конкретные приёмы, а не мотивацию.

Слогер 25.09.2026 ▲ 0
Разработка

Как ловить гонки данных в тестовом задании: разбор задачи про последний товар на складе

Один зелёный тест ничего не доказывает, если весь код крутится в одном процессе. Разбираю, как устроить проверку на двух воркерах и что именно писать в рубрику оценки.

Слогер 25.09.2026 ▲ 0
Fluxs lenta
Реклама · fluxs.ru
Разработка

Как выйти из ступора при выборе архитектуры: 5 книг и рабочий алгоритм

Выбор между монолитом, сервисами и очередью превращается в бесконечное гугление. Разбираем, почему мозг залипает на архитектурных решениях и какие книги дают рамку вместо готового ответа.

Слогер 24.09.2026 ▲ 0
AI

Как выглядит бизнесмен, который перестал держать всё в голове

Как выглядит рабочий день владельца, который перестал держать всё в голове? Утром он открывает мессенджер и видит, кто написал за ночь. Отвечал не менеджер, а AI-чат на сайте по базе знаний. Заявка сама стала карточкой в CRM, а если она неделю стоит без движения, менеджеру падает задача. Как идут дела, он не выясняет по разделам: спрашивает ИИ-ассистента и получает таблицу с графиком. Может продиктовать голосом. Может сказать «заведи задачу Иванову на завтра», ассистент покажет карточку и подождёт его «да». Мы собрали этот день в статью, с Лидогенератором, Веб-клиппером, защищёнными Заметками, Конструктором сайтов и SEO-мониторингом. Портрет собирательный, но каждый модуль в нём настоящий.

Слогер 23.09.2026 ▲ 0
AI

Как ИИ-генераторы фото для профиля используют ваше лицо: разбор цены и данных

Селфи на входе, сорок портретов на выходе. А что остаётся от вашей биометрии после того, как сессия закончилась? Разбираем, как обучается модель, сколько стоит съёмка и что читать в политике до загрузки.

Слогер 23.09.2026 ▲ 0
Fluxs lenta
Реклама · fluxs.ru
Маркетинг

Почему «старые» аккаунты Telegram продают за $10–75 и чем это оборачивается покупателю

На серых площадках «прогретые» профили Telegram продают партиями со скидками до 25%. Разбираем, что за этим стоит, где ломается схема и как построить outreach без покупки чужих аккаунтов.

Слогер 23.09.2026 ▲ 0
Разработка

Разбор: «дефицит вины» — что делать, если прод упал из-за кода, который написал ИИ

Google AI Overview теперь выдаёт определение «дефицита вины» как основной термин по запросу. Разбираем, почему зелёные тесты не доказывают корректность и как выстроить ответственность в команде, где код генерирует модель.

Слогер 23.09.2026 ▲ 0
Карьера

Разбор: как проходить AI-интервью и что алгоритм на самом деле оценивает

Асинхронные видеоинтервью с анализом алгоритмом стали обычной практикой найма. Разбираем, что уходит на ту сторону вместе с записью, что именно оценивает модель и как подготовиться, чтобы не проиграть из-за света в комнате и нервного тика.

Слогер 23.09.2026 ▲ 0
Разработка

Что читать начинающему разработчику: 7 книг и порядок, в котором они работают

Список книг сам по себе бесполезен — работают очерёдность и то, что вы делаете с каждой главой. Разбираем семь классических книг для новичка в коде: зачем каждая, кому подходит и когда её открывать.

Слогер 22.09.2026 ▲ 0
Карьера

Почему вам кажется, что вы самозванец на собеседовании на английском

Чувство «сейчас они всё поймут» у разработчиков из Бразилии, Индии и Восточной Европы — не только психология. Это искажённое прочтение реального неравенства доступа. Разбираем, как отделить язык от навыка и что делать руками.

Слогер 22.09.2026 ▲ 0
Fluxs lenta
Реклама · fluxs.ru