Слогер Создать блог
AI

Как малому бизнесу управлять AI-краулерами: блокировать или пускать?

Разбираемся, какие AI-боты приносят клиентов, а какие просто съедают трафик, и как настроить доступ к сайту без лишнего риска.

AI-краулеры — это уже не проблема только крупных издателей и медиа. Они влияют на то, как клиенты находят местные услуги, сравнивают компании, задают вопросы о покупке и решают, какому сайту доверять. Поэтому у владельцев малого бизнеса появился практический вопрос: пускать ли AI-ботов на сайт, блокировать их или найти промежуточный вариант.

Короткий ответ: большинству малых предприятий стоит разрешить поисковых и пользовательских AI-краулеров, которые могут вернуть видимость, но осторожнее относиться к тренировочным ботам, неизвестным агентам и автоматическому трафику без понятной выгоды. Правильное решение — не «пускать всех» и не «блокировать всех», а письменная политика доступа.

Почему сделка с краулерами сломалась

Раньше всё было просто. Поисковики обходили публичные страницы, индексировали их и возвращали людей через органическую выдачу. Владельцы сайтов разрешали краулинг, потому что трафик того стоил.

AI-поиск усложнил эту сделку. Одни боты обходят сайты, чтобы строить поисковые индексы и потом цитировать ваши страницы. Другие подгружают страницы по запросу конкретного пользователя. Третьи собирают контент для обучения моделей, и выгода для владельца сайта тут совсем неочевидна.

Cloudflare в своём обновлении от 1 июля 2026 года разделил активность AI-ботов на три сценария: Search, Agent и Training. Поисковые краулеры собирают контент для будущих ответов. Агенты действуют в реальном времени от имени человека. Тренировочные краулеры забирают контент для обучения моделей. Это различие важно: малый бизнес может хотеть, чтобы ChatGPT, Perplexity, Claude или Google цитировали его страницы в ответах, но не обязательно хочет, чтобы каждый тренировочный бот копировал весь блог навсегда.

Три категории AI-ботов, которые имеют значение

Малому бизнесу не нужно запоминать каждый юзер-агент в интернете. Нужен каркас для решений.

1. Поисковые краулеры

Это самая простая категория для разрешения. Они помогают AI-поиску находить и цитировать сайты. OpenAI прямо говорит, что OAI-SearchBot используется для показа сайтов в поиске ChatGPT, и что можно разрешить его, заблокировав GPTBot для обучения. Perplexity делает аналогичное разделение: PerplexityBot показывает и ссылается на сайт в результатах, а Perplexity-User — это загрузка по запросу пользователя.

Поисковым краулерам обычно можно открыть публичные маркетинговые страницы, страницы услуг, блог, кейсы, отзывы и FAQ. Именно они приносят цитаты, показы и целевые лиды.

2. Агентские и пользовательские краулеры

Агентский трафик отличается от фонового обхода. Он возникает, когда реальный человек просит AI-ассистента сравнить поставщиков, обобщить страницу, проверить цены или найти контакты. OpenAI называет ChatGPT-User действиями пользователя в ChatGPT, а не автоматическим краулингом; Anthropic — Claude-User как запрос пользователя. Если ассистент не может загрузить ваши публичные страницы, ваш бизнес просто не попадёт в сравнение.

Такой трафик бывает очень близко к решению о покупке. Клиент может спросить: «Найди веб-студию во Флориде, которая работает с малым бизнесом и понимает SEO». Если страницы недоступны — вас не рассмотрят. Но агентский трафик тоже нужно ограничивать: формы, чекауты, бронирование и личные кабинеты стоит защищать от злоупотреблений.

3. Тренировочные краулеры

Самая щепетильная категория. Они собирают контент для улучшения фундаментальных моделей AI. Польза для отдельного малого бизнеса обычно косвенная. К таким относятся GPTBot от OpenAI и ClaudeBot от Anthropic. Некоторые предприятия сознательно их пускают ради максимальной экспозиции, если публикуют не слишком чувствительные материалы. Другие блокируют тренировочных ботов, оставляя поисковых открытыми. Это разумная середина.

Robots.txt — это сигнал для трафика, а не стена безопасности

Первый инструмент, о котором слышат владельцы сайтов — robots.txt. Он полезен, но его часто не понимают. Google Search Central поясняет: robots.txt сообщает краулерам, какие URL им можно посещать, и в основном используется для управления трафиком. Это не механизм для удаления страницы из результатов Google. Для скрытия приватных материалов нужны более сильные инструменты: noindex или парольная защита.

Важно понимать: robots.txt — это просьба, а не приказ. Приличные краулеры обычно её уважают, плохие или небрежные — игнорируют. Вот что robots.txt делает хорошо:

  • Выражает политику доступа.
  • Сокращает бесполезный краулинг.
  • Позволяет или запрещает конкретных AI-ботов.
  • Разделяет поисковых и тренировочных краулеров, если вендор поддерживает такое разделение.

Чего он не делает:

  • Не защищает конфиденциальный контент.
  • Не останавливает враждебный скрапинг сам по себе.
  • Не блокирует весь ботовый трафик на сетевом уровне.
  • Не гарантирует, что запрещённый URL не появится нигде в интернете.

Если информация не должна быть публичной, полагаться только на robots.txt нельзя.

Что Google говорит об AI-видимости

Позиция Google проста: базовые принципы SEO одинаково работают для AI Overviews и AI Mode. Страницы должны быть доступны для краулинга, индексироваться, иметь сниппеты, быть внутренне связанными, полезными, с текстом, медиа и структурированными данными. Никаких дополнительных технических требований нет.

Отсюда правило для политики: если хотите, чтобы Google Search и AI-функции понимали публичную страницу, не блокируйте Googlebot. AI-функции используют те же правила краулинга, что и обычный поиск. А вот Google-Extended — это отдельная история, он предназначен для ограничения обучения и обработки в других системах Google.

Практический вывод: не смешивайте контроль видимости в поиске с отказом от обучения. Это разные решения.

Практическая политика доступа для малого бизнеса

Вот простой стартовый вариант для сервисной компании, которая хочет видимости, но не хочет отдавать контроль вслепую.

Разрешите поисковых краулеров на публичные маркетинговые страницы

Откройте доступ для Googlebot, OAI-SearchBot, PerplexityBot и других репутационных поисковых ботов. Публичные страницы, которые обычно стоит оставить краулингу:

  • Главная.
  • Страницы услуг.
  • О компании.
  • Контакты.
  • Блог.
  • FAQ.
  • Кейсы и портфолио.
  • Отзывы.

Эти страницы поддерживают SEO, AEO и GEO — они рассказывают поисковым системам и ответным движкам, кто вы, что делаете, где работаете и почему вам можно верить.

Подумайте о блокировке тренировочных краулеров, если контент проприетарный

Если на сайте есть оригинальные исследования, платные ресурсы, подробные шаблоны, эксклюзивные гайды, авторские методики — заблокируйте тренировочных ботов, оставив поисковых. Это ключевая деталь, которую многие упускают. Блокировка всех AI-ботов снижает обнаружимость. Разрешение всех — отдаёт больше, чем вы планировали. Более зрелый вариант — разделить политику по сценарию использования.

Держите пользовательских агентов открытыми для публичных страниц

Они помогают ассистентам отвечать на вопросы о бизнесе в моменте. Для малого бизнеса это ценно. При этом защитите формы, приватные инструменты, админку, стейджинг и всё, что требует авторизации.

Используйте WAF и бот-менеджмент для защиты

Когда поведение краулера становится агрессивным, нужны более сильные меры, чем robots.txt: фаервол, CDN-менеджмент ботов, rate limiting и проверка IP. Perplexity, например, рекомендует использовать и юзер-агент, и официальные IP-диапазоны при настройке WAF. Один только юзер-агент легко подделать.

Мониторьте результат

Политика краулинга — не разовая настройка. Пересматривайте её раз в квартал или месяц. Следите за:

  • Падением показов в Google Search Console.
  • Исчезновением важных страниц из цитат AI-поиска.
  • Внезапными скачками ботового трафика.
  • Нагрузкой на сервер от подозрительных краулеров.
  • AI-рефералами, которые превращаются в лиды.
  • Ростом брендовых запросов после AI-видимости.
  • Ошибками краулинга из-за CDN или WAF.

Google предупреждает: не доверяйте сторонним инструментам, которые заявляют о доступе к внутренним AI-системам ранжирования. Личные данные о лидах — лучший финальный тест.

Сравнение категорий AI-краулеров

КатегорияПримеры ботовЧто делаютТипичное решение для малого бизнеса
ПоисковыеGooglebot, OAI-SearchBot, PerplexityBotИндексируют и цитируют сайты в AI-поискеРазрешить на публичных страницах
Агентские / пользовательскиеChatGPT-User, Claude-User, Perplexity-UserПодгружают страницы по запросу пользователя в реальном времениРазрешить на публичном, защитить формы и личные зоны
ТренировочныеGPTBot, ClaudeBot, PerplexityBot (в части политики)Собирают контент для обучения моделейБлокировать при наличии проприетарного контента; разрешать при максимальной экспозиции

Pay Per Crawl: экзотика, которая многое меняет

Cloudflare в 2025 году запустил в приватной бете Pay Per Crawl — механизм, позволяющий владельцам сайтов разрешать, брать деньги или блокировать AI-краулеры. Он использует HTTP-статус 402 Payment Required. Для большинства малых бизнесов это не первый шаг: локальная услуга зарабатывает на том, что её находят и связываются, а не на плате за чтение страниц.

Но Pay Per Crawl важен как сигнал: веб движется к более явным правилам доступа. Владельцы сайтов начали задавать правильные вопросы: кто краулит мой контент, зачем, возвращают ли пользователей, уважают ли мои предпочтения, могу ли я измерить отдачу. Ответ для малого бизнеса чаще всего прежний: «разрешить поиск, мониторить агентов, ограничить обучение там, где нужно».

Частые ошибки и как их избежать

Ошибка первая — блокировать всех подряд. Иногда выстреливает по видимости: вы исчезаете из ChatGPT, Perplexity и Google AI Mode. Вторая ошибка — не разделять типы ботов. Третья — думать, что robots.txt защитит конфиденциальность. Четвёртая — забыть про WAF и IP. Пятая — не мониторить последствия.

Лучше всего начать с простого правила: если страница публичная и полезная — пусть её читают поисковые боты и пользовательские агенты. Тренировочным — решайте отдельно. И не забывайте: llms.txt — не обязателен, Google его не требует.

Итог

AI-краулеры — это не зло и не панацея. Это каналы, которые нужно настраивать исходя из целей бизнеса. Разделите политику на три категории, оформите её в robots.txt, защитите чувствительные зоны, следите за цифрами. Тогда вы сохраните видимость в AI-поиске, не раздавая контент бесплатно тем, кто от этого не даёт отдачи.

По материалам: marketing. Текст переработан редакцией Слогера.

← На главную

Рекламное место — Конец поста
Реклама · Слогер

Комментарии (0)

Войдите, чтобы комментировать.

Пока нет комментариев. Будьте первым.