The full problem statement is available to Pro members.
preloaded fixtures
import pandas as pd
import numpy as np
query_log = pd.DataFrame({
"warehouse": ["ANALYST_WH", "ANALYST_WH", "ETL_WH", "ETL_WH", "BI_WH", "BI_WH", "ML_WH", "ML_WH"],
"user_name": ["ada", "grace", "etl_bot", "etl_bot", "bi_service", "grace", "ml_bot", "ml_bot"],
"day": ["2024-03-01", "2024-03-02", "2024-03-01", "2024-03-02", "2024-03-02", "2024-03-04", "2024-03-06", "2024-03-07"],
"elapsed_sec": [12.5, 180.0, 900.0, 840.0, 22.0, 240.0, 3600.0, 1800.0],
"bytes_scanned": [1200000, 52000000, 880000000, 790000000, 3400000, 61000000, 2400000000, 1200000000],
"spilled": [0, 1, 1, 0, 0, 1, 1, 0],
})
query_log["day"] = pd.to_datetime(query_log["day"])
credits = pd.DataFrame({
"warehouse": ["ANALYST_WH", "ANALYST_WH", "ETL_WH", "ETL_WH", "BI_WH", "ML_WH", "ML_WH"],
"day": ["2024-03-01", "2024-03-02", "2024-03-01", "2024-03-02", "2024-03-02", "2024-03-06", "2024-03-07"],
"credits": [1.5, 6.0, 40.0, 36.0, 2.5, 60.0, 30.0],
})
credits["day"] = pd.to_datetime(credits["day"])
This is a Pro problem
“Scan efficiency per warehouse” is part of the Pro problem set. Upgrade to unlock the harder half of every track — SQL, Python and pandas.
The first problems in each track stay free.