Технологии5 мин чтения

Большие данные.

Big Data · большие данные · биг-дата · большие массивы данных · модель V (3V/5V)

Большие данные — массивы информации, чей объём, скорость и разнородность не тянет одна СУБД или Excel, поэтому нужны распределённые технологии.

Что это простыми словами

Большие данные (Big Data) — это потоки информации, которые настолько велики, быстры и разношёрстны, что обычные инструменты их не переваривают. Одна база захлёбывается, Excel падает на втором миллионе строк, а считать всё на одной машине уже физически некуда. Поэтому данные раскидывают по десяткам и сотням серверов и обрабатывают распределёнными технологиями вроде Hadoop и Spark.

Классически большие данные описывают моделью «V». Три базовых признака: Volume (объём — терабайты и петабайты), Velocity (скорость — данные льются непрерывным потоком в реальном времени) и Variety (разнообразие — вперемешку чеки, клики, фото, геолокация, голос, логи). Позже добавили ещё два: Veracity (достоверность — насколько данным можно верить) и Value (ценность — какой с них выхлоп). Аналогия: обычная аналитика — это аккуратная картотека, по которой вы ходите ножками. большие данные — товарный поезд, который проносится мимо без остановки, и нужна целая бригада, чтобы успевать разгружать вагоны на ходу.

Зачем это бизнесу

Когда данных столько, что человек и одна табличка их не осилят, в них прячутся закономерности, которые иначе не увидеть: что купят завтра, где встанет логистика, какая транзакция — мошенничество, какой цене покупатель не удивится. большие данные превращают этот поток в решения почти в реальном времени — динамические цены, прогноз спроса, антифрод, персональные рекомендации.

Но честная оговорка про деньги: это дорогая инфраструктура. Дата-озеро, кластеры, отдельная команда дата-инженеров и data scientists стоят серьёзных бюджетов и окупаются только на по-настоящему больших объёмах. Если у вас тысячи строк, большие данные не дадут «ещё больше пользы» — они дадут счёт за серверы и ноль инсайтов сверх обычного BI.

Как считается

Большие данные — не метрика, формул и чисел в рублях тут нет. Есть эвристика отнесения — та самая модель «V». Проверяете данные по признакам и решаете, большие они или обычные:

Модель V (Doug Laney, Gartner, 2001 → позже расширена до 5V):
  Volume    — объём: гигабайты помещаются в БД? петабайты — уже нет
  Velocity  — скорость: разовая выгрузка или непрерывный поток?
  Variety   — разнообразие: одна таблица или вперемешку текст/фото/логи?
  Veracity  — достоверность: данным можно верить?
  Value     — ценность: есть ли с них реальный выхлоп?

Правило отсечки:
  данные влезают в одну таблицу/БД и считаются на одной машине
    → это ОБЫЧНЫЕ данные (SQL, BI, Excel)
  данные не помещаются/не считаются на одной машине и льются потоком
    → это большие данные (распределённые технологии)

Пример. У интернет-магазина 50 000 клиентов и история заказов. Volume — десятки мегабайт, влезает в одну таблицу. Velocity — данные обновляются пару раз в день, не поток. Variety — всё структурировано в строки и колонки. Вывод: это не Big Data, отток и выручку спокойно считает обычный SQL или BI. А теперь маркетплейс федерального масштаба: миллиарды событий в день, клики и просмотры в реальном времени, вперемешку структурированные заказы и неструктурированные отзывы с фото. Тут все «V» зашкаливают — это уже большие данные.

Примеры из жизни

  • X5 Group (Пятёрочка, Перекрёсток). На больших данных о чеках, остатках и спросе крутится динамическое ценообразование для десятков тысяч магазинов и прогноз спроса с логистикой. Вручную свести спрос по сети такого масштаба нереально — без распределённой обработки цена и поставки слепнут.
  • Яндекс. Поиск, предсказание пробок, таргетинг рекламы, рекомендации в Маркете и Музыке — всё стоит на анализе гигантских потоков пользовательских данных. Каждый ваш клик и маршрут — вагон того самого товарного поезда.
  • Сбер. Скоринг, антифрод и персональные предложения в реальном времени на транзакциях десятков миллионов клиентов. Мошенническую операцию надо поймать за доли секунды, пока деньги не ушли, — классическая задача Velocity, которую большая команда data scientists решает на распределённом стеке.

Когда это про вас

Большие данные — про вас, когда данные перестали помещаться и считаться на одной машине и поступают непрерывным потоком: миллиарды событий, real-time, вперемешку структура и сырьё. Это уровень крупного e-commerce, банков, телекома, рекламных платформ.

А вот честно, кому пока рано. Малому и среднему бизнесу с «человеческими» объёмами — тысячи и сотни тысяч строк чеков, клиентов, проводок — большие данные не нужны: всё спокойно считает обычная БД, BI-инструмент или даже таблица. Анализ оттока по 10 тысячам клиентов — это НЕ задача больших данных, это обычная аналитика. На стадии стартапа и MVP вкладываться в Big Data-стек (Hadoop, Spark, дата-озеро, отдельная команда инженеров) — преждевременная оптимизация и слив бюджета на проблему, которой у вас ещё нет. Порог наступит сам, когда данные перерастут одну машину, — и вы это точно заметите.

Грабли и мифы

  • «большие данные — только для корпораций, и нам надо тоже». Половина правды: да, это история про масштаб, но вывод неверный. Малому бизнесу почти всегда хватает обычной аналитики — SQL, BI, Excel. Гнаться за большими данными с тысячами строк — покупать товарный поезд, чтобы отвезти один пакет из магазина.
  • «Чем больше данных, тем лучше» и «данные сами дадут инсайты». Ценность даёт не объём, а качество и интерпретация — те самые Veracity и Value. Сырые данные без гипотез и моделей дают либо ноль, либо ложные выводы: корреляцию примут за причину и наломают дров. Гора мусорных данных — это просто большая гора мусора.
  • Путают большие данные с любой аналитикой или с ИИ. большие данные — про инфраструктуру работы с большими, быстрыми и разнородными данными, а не про дашборд из выгрузки на 5 тысяч строк и не про нейросеть. Красивый график в BI — это аналитика, а не большие данные.
Частые вопросы
Чем большие данные отличаются от обычной аналитики?
Обычная аналитика работает с данными, которые помещаются в одну таблицу или базу и считаются на одной машине: SQL-запросы, BI-дашборды, Excel. большие данные — про объёмы и потоки, которые одна машина не тянет, поэтому их раскидывают по кластеру серверов. Дашборд из выгрузки на 5 тысяч строк — это аналитика, а не Big Data.
Что такое 3V и 5V в больших данных?
Это модель признаков больших данных. 3V (Doug Laney, Gartner, 2001): Volume — объём, Velocity — скорость поступления, Variety — разнообразие форматов. Позже добавили ещё два до 5V: Veracity — достоверность данных и Value — их ценность. Чем сильнее зашкаливают эти признаки, тем больше данные похожи на настоящие большие.
Нужны ли большие данные малому бизнесу?
Почти никогда. Малому и среднему бизнесу с тысячами и сотнями тысяч строк (чеки, клиенты, проводки) хватает обычной базы, BI-инструмента или даже таблицы. Анализ оттока по 10 тысячам клиентов — это не Big Data. Вкладываться в дата-озеро и команду инженеров на старте — преждевременная оптимизация и слив бюджета.
большие данные — это то же самое, что искусственный интеллект?
Нет. большие данные — про инфраструктуру хранения и обработки больших, быстрых и разнородных данных. ИИ — про модели, которые на этих данных учатся. Они часто работают вместе: алгоритмы машинного обучения кормят большими данными. Но сами по себе это разные вещи, и одно не равно другому.
Когда бизнесу пора переходить на технологии больших данных?
Когда данные перестают помещаться и считаться на одной машине и поступают непрерывным потоком — миллиарды событий, реальное время, вперемешку структура и сырьё. Это уровень крупного e-commerce, банков, телекома, рекламных платформ. Порог вы заметите сами: обычная база начнёт захлёбываться, а отчёты считаться часами.
Источники
  • Doug Laney, «3D Data Management: Controlling Data Volume, Velocity and Variety» — META Group / Gartner, 2001 (исходная модель 3V)

Хотите видеть это в своих цифрах, а не в теории?

артефакты считают всё это автоматически — на ваших данных. Покажем за один созвон, без слайдов.