Google Dataflow научился фильтровать потоки данных с помощью ИИ и снижать затраты

Google Dataflow научился фильтровать потоки данных с помощью ИИ и снижать затраты

Технологии

Автор материала

Екатерина Орлова

Автор материалов о природе, экотропах и спокойном отдыхе рядом с озёрами, лесами и заказниками.

Google Cloud представил архитектуру для генеративных ИИ-пайплайнов в сервисе потоковой обработки Dataflow. Решение сочетает лёгкую модель машинного обучения на CPU и агентный ИИ, что позволяет обрабатывать миллионы событий в реальном времени.

До 95% сообщений в типичном бизнес-потоке (отзывы клиентов или логи систем) не требуют сложного анализа. Вместо отправки каждого события в тяжёлую языковую модель пайплайн сначала пропускает данные через компактную модель на основе DistilBERT, работающую на CPU воркеров Dataflow.

Если модель определяет негативный или критический сигнал, событие передаётся агенту на базе Gemini 3.5 Flash. Агент использует инструменты для запросов к BigQuery и отправки email через Gmail API, динамически принимая решение: найти заказ, проверить склад, отправить уведомление.

Архитектура применима в IT-операциях (фильтрация логов), финансовом мониторинге (выявление подозрительных транзакций) или промышленном IoT (реагирование на аномалии датчиков). Лёгкий фильтр отсеивает рутину, агент берёт на себя редкие, но сложные сценарии.

Google Cloud опубликовал пример реализации на Apache Beam с использованием Agent Development Kit (ADK) и RunInference. Пайплайн читает сообщения из Pub/Sub, классифицирует тональность и при негативном результате запускает агента для автоматического урегулирования инцидента.

Практическая польза: снижение затрат на API больших языковых моделей, уменьшение задержек обработки и упрощение поддержки сложной логики. Вместо переписывания пайплайна при каждом новом типе событий достаточно настроить агента, который адаптируется к данным.

Последние новости и статьи