# Workshop trip data month (trainer)

Single place to set which **NYC TLC Yellow Taxi Parquet month** the class uses. Pipelines do **not** hardcode a filename — they read everything under `raw/trips/` on ADLS2 — but trainers must upload the correct file before delivery.

## Configure before each delivery

Edit [`workshop-data.json`](../workshop-data.json) in the repo root of `workshop-2026-v2/`:

```json
{
  "tripDataYear": 2024,
  "tripDataMonth": 10
}
```

| Field | Meaning |
|-------|---------|
| `tripDataYear` | Four-digit year from TLC filename |
| `tripDataMonth` | Month number `1`–`12` (no leading zero in JSON) |

**Derived filename:** `yellow_tripdata_{year}-{month:02d}.parquet`  
Example for the defaults above: `yellow_tripdata_2024-10.parquet`

## Download and upload

1. [NYC TLC Trip Record Data](https://www.nyc.gov/site/tlc/about/tlc-trip-record-data.page) → **Yellow Taxi** → **Parquet** → pick the month matching `workshop-data.json`.
2. Upload to ADLS2 container `nyc-taxi-data`:
   - Trips: `raw/trips/<your-yellow_tripdata_YYYY-MM.parquet>`
   - Lookup (unchanged): `raw/lookup/taxi_zone_lookup.csv`

## Pipeline behaviour

| Component | Path used |
|-----------|-----------|
| Databricks `00_setup.py` | `.../raw/trips/` (directory) |
| Databricks / Snowpark Bronze | All Parquet under stage / ADLS2 `raw/trips/` |
| Snowflake `LIST @nyc_taxi_trips_stage` | `PATTERN = '.*parquet'` |

Keep **only the workshop month** in `raw/trips/` unless you deliberately want multi-month Bronze loads.

## Trainer checklist

See [Pre-class checklist § ADLS2 storage](../../trainer/pre-class-checklist/01-adls2-storage.qmd).

## Related

- [Use case — data source](../story/use-case-yellowline-nyc.qmd)
- [Data model](../../reference/data-model.qmd)
