The full problem statement is available to Pro members.
preloaded fixtures
import pandas as pd
import numpy as np
runs = pd.DataFrame({
"job_name": ["bronze_ingest", "silver_clean", "gold_marts", "bronze_ingest", "train_churn", "train_churn", "gold_marts", "dashboard_refresh"],
"cluster": ["etl-nightly", "etl-nightly", "etl-nightly", "etl-nightly", "ml-training", "ml-training", "etl-nightly", "bi-serving"],
"day": ["2024-03-01", "2024-03-01", "2024-03-01", "2024-03-02", "2024-03-02", "2024-03-03", "2024-03-06", "2024-03-05"],
"duration_min": [45.0, 62.5, 30.0, 48.0, 210.0, 195.0, 35.0, 12.0],
"status": ["success", "success", "failed", "success", "success", "failed", "success", "success"],
"retries": [0, 1, 3, 0, 0, 2, 1, 0],
})
runs["day"] = pd.to_datetime(runs["day"])
tables = pd.DataFrame({
"catalog": ["bronze", "bronze", "silver", "silver", "gold", "gold"],
"table_name": ["events_raw", "clicks_raw", "events_clean", "users_clean", "daily_revenue", "churn_features"],
"size_gb": [4200.0, 980.0, 2100.0, 85.0, 12.0, 44.0],
"file_count": [180000, 64000, 9000, 1200, 300, 15000],
})
This is a Pro problem
“Small file ratio per catalog” is part of the Pro problem set. Upgrade to unlock the harder half of every track — SQL, Python and pandas.
The first problems in each track stay free.