Big data - что это?
FinOps для Big Data: как найти скрытые расходы в Spark-кластерах и storage-тирах
Стоит начать с механизма, который прячет реальную стоимость там, где её меньше всего ожидают искать. Само хранилище — S3, ADLS, GCS — стоит относительно дёшево за гигабайт, но то, как именно данные записаны, напрямую определяет, сколько вычислительной мощности потребуется, чтобы их прочитать. Таблица из миллионов крошечных файлов создаёт колоссальные накладные расходы на метаданные, заставляя исполнителей Spark сканировать избыточное число файлов Parquet, раздувая число операций ввода-вывода и удлиняя время выполнения запроса. Это продлевает время работы кластера и одновременно умножает и стоимость...