all problems

Small file ratio per catalog PRO

pandasmediummergederived metrics

The full problem statement is available to Pro members.

preloaded fixtures

import pandas as pd
import numpy as np

runs = pd.DataFrame({
    "job_name": ["bronze_ingest", "silver_clean", "gold_marts", "bronze_ingest", "train_churn", "train_churn", "gold_marts", "dashboard_refresh"],
    "cluster": ["etl-nightly", "etl-nightly", "etl-nightly", "etl-nightly", "ml-training", "ml-training", "etl-nightly", "bi-serving"],
    "day": ["2024-03-01", "2024-03-01", "2024-03-01", "2024-03-02", "2024-03-02", "2024-03-03", "2024-03-06", "2024-03-05"],
    "duration_min": [45.0, 62.5, 30.0, 48.0, 210.0, 195.0, 35.0, 12.0],
    "status": ["success", "success", "failed", "success", "success", "failed", "success", "success"],
    "retries": [0, 1, 3, 0, 0, 2, 1, 0],
})
runs["day"] = pd.to_datetime(runs["day"])

tables = pd.DataFrame({
    "catalog": ["bronze", "bronze", "silver", "silver", "gold", "gold"],
    "table_name": ["events_raw", "clicks_raw", "events_clean", "users_clean", "daily_revenue", "churn_features"],
    "size_gb": [4200.0, 980.0, 2100.0, 85.0, 12.0, 44.0],
    "file_count": [180000, 64000, 9000, 1200, 300, 15000],
})

This is a Pro problem

“Small file ratio per catalog” is part of the Pro problem set. Upgrade to unlock the harder half of every track — SQL, Python and pandas.

Upgrade to Pro

The first problems in each track stay free.