Опросов про дата-инженерию выходит много. Обычно это двести ответов из чьего-то Slack-канала, которые потом называют репрезентативной выборкой. Отчёт Astronomer State of Apache Airflow 2026 — случай другого порядка: 5 818 респондентов из 122 стран, 50 вопросов, сбор с 15 сентября по 20 ноября 2025 года. Сам Astronomer называет это крупнейшим исследованием в области дата-инженерии.
Годом раньше в опросе участвовали 5 250 человек из 116 стран. Рост около 10%. Цифры полезны всем, кто выбирает инструменты, планирует миграцию или ходит по собеседованиям: видно, что действительно стоит в проде, а не что громче всех обсуждают в лентах.
84% планируют миграцию. 26% её завершили
Airflow 3 вышел в апреле 2025-го. К моменту опроса 26% респондентов миграцию закончили, а 84% из тех, кто остался на 2.x, говорят, что планируют. Разрыв в 58 процентных пунктов — это команды, которые смотрят на список ломающих изменений и закладывают под них реальное проектное время.
Изменения там не косметические:
- SubDAGs удалены полностью;
- контекстные переменные execution_date, prev_ds и next_ds больше не существуют;
- воркеры потеряли прямой доступ к метабазе — всё идёт через REST API;
- xcom_pull(key=) перестаёт искать значение в апстрим-тасках.
Каждый пункт означает переписывание DAG. Если у вас в проде 300 дагов и половина использует execution_date для логики партиционирования, вы получите недели рефакторинга ещё до того, как дойдёте до CI-пайплайна. Отсюда и разрыв.
У клиентов managed-платформы Astronomer картина другая: 48% уже работают на Airflow 3, а среди крупнейших заказчиков (от 50 000 сотрудников) — 60%. Это история про ресурсы: у таких компаний есть выделенные платформенные команды, которые тянут миграцию параллельно с обычной работой. Команда из четырёх человек на Series B со 150 дагами запланирует перенос на третий квартал, сдвинет на четвёртый, потом на первый.
И часы тикают. Airflow 2 достиг конца жизненного цикла в апреле 2026 года: ни патчей безопасности, ни багфиксов, ни обновлений провайдеров. Провайдеры Snowflake, Databricks и BigQuery начнут отказываться от поддержки 2.x в своих пакетах через 6–12 месяцев после официального EOL. Для SOC 2, HIPAA и PCI-DSS требуется поддерживаемое ПО, так что техническая задача превращается ещё и в комплаенс-разговор.
84% команд знают, что мигрировать нужно. 26% это сделали. Вся разница — реальная цена переписывания продакшен-дагов, пока бизнес ждёт отчёты.
Если вы сейчас проходите собеседования, готовьтесь к вопросам и про Airflow 2, и про Airflow 3 — минимум ещё год рынок будет жить в двух версиях одновременно.
GenAI в проде: разрыв в 51 процентный пункт
Среди всех пользователей Airflow 32% держат GenAI- или MLOps-нагрузки в продакшене. Среди клиентов managed-платформы Astronomer — 62%. Среди тех, кто пользуется ею больше двух лет, — 83%.
Дело не в амбициях, а в зрелости инфраструктуры, которая накапливается годами. Команды, вложившиеся в наблюдаемость, обработку ошибок, управление схемами и идемпотентность пайплайнов, прикручивают инференс почти без сопротивления — вся «сантехника» уже на месте. Те, кто до сих пор выясняет, почему ночной батч падает через раз, к оркестрации инференса не готовы. Они это понимают и правильно ждут.
Отдельное исследование K2view 2026 подтверждает: 76% организаций называют качество и согласованность данных главным барьером для GenAI в продакшене, 62% прямо говорят, что корпоративные данные не готовы. В том же разборе приводится исследование MIT: 95% корпоративных пилотов ИИ не дают никакого вклада в P&L. Разрыв между пилотом и продакшеном структурный, более умной моделью его не закрыть.
Больше 80% респондентов используют ИИ-инструменты для написания пайплайнов — и жалуются на галлюцинации, отсутствие контекста и устаревший синтаксис. ИИ давно обесценил алгоритмические секции на собеседованиях как сигнал об инженерных способностях, но как автор пайплайнов он пока далёк от того, кто знает, почему пайплайн упал в три часа ночи во вторник и как сделать, чтобы это не повторилось.
89% пользователей Airflow ожидают в 2026 году расширить оркестрацию на внешние решения, приносящие выручку. Слой оркестрации переезжает из бэк-офиса в продуктовую инфраструктуру. Работа дата-инженера становится куда заметнее для бизнеса. Это одновременно и хорошо, и страшновато.
Платформы: объявлять победителя рано
В лентах принято считать, что Databricks уходит в отрыв. По данным опроса — не так быстро.
| Платформа | Доля респондентов | Что спрашивают на собеседовании |
|---|---|---|
| Snowflake | 36,6% | Трёхслойная архитектура (storage, compute, cloud services), управление стоимостью warehouse, стратегии кластеризации, паттерны загрузки через Snowpipe |
| Databricks | 34,7% | Внутренности Spark: семантика shuffle, партиционирование; ACID-транзакции Delta Lake; мышление распределёнными системами под конкурентной нагрузкой |
| BigQuery | 27,8% | — |
Разрыв между первым и третьим местом — меньше 9 процентных пунктов. Snowflake опережает Databricks меньше чем на два. Кроме того, 22% пользователей Airflow работают с двумя и более крупными облачными платформами одновременно. Каждая пятая команда держит гетерогенный стек осознанно, а не из-за технического долга.
Для подготовки к собеседованиям это критично. Snowflake и Databricks — принципиально разные поверхности: один учебный план на оба не сработает и научит вас не тому на половине собеседований. Смотрите в текст вакансии. Написано Snowflake — копайте Snowflake. Написано Databricks — Databricks. Написано и то и другое, значит, в компании сами пока не определились, — спрашивайте на созвоне с рекрутером. Три недели, потраченные на не ту платформу, обиднее всего.
Но аргумент про концепции вместо инструментов остаётся в силе. Моделирование данных, оптимизация запросов и понимание того, почему всё сломалось, переносятся на любую из трёх платформ. Инженер, который понимает гранулярность фактов, нормальные формы и поздно приходящие данные, пройдёт интервью где угодно после недели на освежение синтаксиса. Тот, кто заучил COPY INTO, но не объяснит slowly changing dimension, поплывёт при любом логотипе в описании вакансии. А раунд на Python сейчас есть почти везде — и на нём спрашивают паттерны из продакшена, а не головоломки с LeetCode.
Чего в этом опросе нет
Astronomer спонсирует исследование и продаёт управляемую версию того самого продукта, который измеряет. Отчёт смешивает ответы сообщества с «трендами из данных об использовании Astro», то есть 5 818 — это добровольные респонденты плюс сигналы телеметрии вендора. Доля ответивших и доверительные интервалы не публикуются, сырые данные закрыты. Цифры, в которых managed-клиенты выглядят лучше по всем метрикам сразу, стоит читать с поправкой на источник.
Обесценивает ли это выводы? Нет. Пять с лишним тысяч человек из 122 стран — крупнейшая выборка в области, которую я видел. Разрыв миграции, сплит платформ, кривая внедрения GenAI — всё это полезно как направление, а не как точные координаты.
Инструменты меняются каждые 18 месяцев. Проблемы — нет: дрейф схем, поздно приходящие данные, апстрим-команды, молча ломающие контракты. Разрыв между «планирую» и «задеплоил» — то место, где и делается карьера. Практический шаг на сегодня: посчитайте, сколько ваших дагов используют execution_date и SubDAGs. Это и есть честная оценка объёма миграции — задолго до того, как её спросят на совете директоров.
Комментарии (0)
Войдите, чтобы комментировать.
Пока нет комментариев. Будьте первым.