Data Lake
Veri Gölü
- Okunuşu
- deyta leyk
Kısaca
Data lake, büyük miktarda ham veriyi, yapılandırılmış olsun ya da olmasın, biri analiz etmek isteyene kadar özgün biçiminde tutan merkezi bir depolama alanıdır.
Data lake nedir?
Data lake, ham veri için, geldiği hangi biçimde olursa olsun, büyük ve merkezi bir depodur: veritabanı dışa aktarımları, uygulama günlükleri, tıklama akışı olayları, JSON dosyaları, görseller ve sensör okumaları. Veri dosya olarak, genellikle ucuz ve son derece ölçeklenebilir nesne depolamasında tutulur. Data warehouse'un aksine data lake, bir şey saklamadan önce bir şema tanımlamanızı gerektirmez.
Göldeki dosyalar klasörlere, çoğu zaman tarihe ya da kaynağa göre bölümlenerek düzenlenir ve genellikle analitik sorguları verimli kılan Parquet gibi sütunlu biçimlerde kaydedilir. Bir katalog hangi veri kümelerinin var olduğunu ve sütunlarının neye benzediğini kaydeder; sorgu motorları dosyaları doğrudan SQL ile okur ve yapıyı okuma zamanında uygular; bu yaklaşıma okurken şema (schema-on-read) denir. Apache Iceberg ve Delta Lake gibi açık tablo biçimleri, düz dosyaların üzerine transaction'lar, şema değişiklikleri ve zaman yolculuğu (time travel) ekler; bu da göl depolamasını warehouse tarzı tablolarla birleştiren lakehouse yaklaşımının temelidir.
Data warehouse etiketli raflarında kullanıma hazır ürünler olan bir süpermarketse, data lake birçok akarsudan gelen suyun doğal haliyle toplandığı ve yalnızca biri ondan çektiğinde süzüldüğü bir rezervuardır. Data lake'ler, özellikle verinin tam olarak hangi soruları yanıtlayacağı henüz bilinmediğinde, makine öğrenmesi eğitim verisi, veri bilimi keşfi, ucuz uzun vadeli saklama ve günlük arşivleri için kullanılır.
Temel karışıklık data warehouse ile yaşanır. Warehouse, iş raporlaması için tasarlanmış temizlenmiş, yapılandırılmış, modellenmiş veriyi saklar ve şemayı veri yazılırken uygular; lake ise her şeyi ham saklar, daha ucuz ve daha esnektir ancak sorgulaması daha yavaş ve güvenmesi daha zordur. Katalog, kalite kontrolleri ve erişim denetimi olmadan bir lake, kimsenin yolunu bulamadığı bir veri bataklığına (data swamp) dönüşür. Birçok kuruluş ikisini birlikte kullanır; ETL ya da ELT hatları lake verisini warehouse tablolarına rafine eder.
Önemli noktalar
- Data lake, her türden ham veriyi, genellikle nesne depolamasında dosya olarak saklar.
- Yapı, veri yazılırken değil, okunurken uygulanır.
- Parquet gibi sütunlu biçimler ve bir veri kataloğu göllerin kullanılabilir olmasını sağlar.
- Lakehouse, bir gölün üzerine warehouse tarzı tablolar ve transaction'lar ekler.
- Yönetişim olmadan bir data lake, kullanılamaz bir veri bataklığına dönüşür.
Örnek
-- Files in the lake are partitioned by date:
-- lake/clickstream/date=2026-09-29/part-0001.parquet
-- lake/clickstream/date=2026-09-30/part-0001.parquet
-- The engine reads the schema from the files themselves
SELECT page, COUNT(*) AS views
FROM read_parquet('lake/clickstream/date=2026-09-30/*.parquet')
GROUP BY page
ORDER BY views DESC
LIMIT 10;Sık sorulan sorular
Data lake ile data warehouse arasındaki fark nedir?
Data lake, her türden ham veriyi ucuza saklar ve yapıyı yalnızca okunurken uygular. Data warehouse ise şeması baştan tanımlanmış, temizlenmiş, yapılandırılmış veriyi saklar; bu da onu iş raporlaması için daha hızlı ve daha güvenilir kılar.
Data lakehouse nedir?
Lakehouse, veriyi göl depolamasında açık dosya biçimlerinde tutar, ancak üzerine transaction'lar, şemalar ve hızlı SQL sorguları olan bir tablo katmanı ekler. Veriyi ayrı bir warehouse'a kopyalamadan warehouse tarzı güvenilirlik sunmayı hedefler.
Data swamp nedir?
Data swamp, dağınık hale gelmiş; kimsenin bulamadığı ya da güvenemediği, belgelenmemiş, tekrarlı veya düşük kaliteli veri içeren bir data lake'tir. Kataloglar, sahiplik ve kalite kontrolleri onu önler.
Sık karşılaştırılanlar
İlgili sayfalar
- Data WarehouseVeritabanları, s. 7Data warehouse, birçok kaynaktan geçmiş veriyi toplayan ve ekiplerin büyük raporlama sorgularını hızla çalıştırdığı analitik amaçlı merkezi bir veritabanıdır.
- ETLVeritabanları, s. 12ETL, kaynak sistemlerden veriyi çıkaran, temiz ve tutarlı bir biçime dönüştüren ve bir hedef depoya yükleyen bir veri entegrasyonu sürecidir.
- Nesne DepolamaDevOps ve Bulut, s. 34Nesne depolama, veriyi benzersiz anahtarlı ve meta verili bütün nesneler olarak, HTTP üzerinden çok sayıda dosyaya ölçeklenen düz bucket'larda saklar.
- Makine ÖğrenmesiYapay Zekâ ve Makine Öğrenmesi, s. 30Makine öğrenmesi, bilgisayarların elle yazılmış kurallar yerine verilerdeki örüntüleri öğrenerek tahmin yaptığı bir yapay zekâ dalıdır.
- Veritabanı ŞemasıVeritabanları, s. 42Veritabanı şeması, bir veritabanının tablolarını, sütunlarını, veri türlerini, ilişkilerini ve saklanan verinin uyması gereken kuralları tanımlayan planıdır.
- Eğitim VerisiYapay Zekâ ve Makine Öğrenmesi, s. 17Eğitim verisi, bir makine öğrenmesi modelinin öğrendiği örnekler kümesidir; kalitesi, boyutu ve kapsamı modelin ne kadar iyi çalışacağını büyük ölçüde belirler.
Bu sayfada bir hata ya da eksik mi gördünüz?Düzeltme önerin