Rate-Assured GPU Inference for 5G AI Slices
This work designs a GPU scheduler that combines Hierarchical Token Bucket-based traffic conditioning with Earliest Deadline First scheduling and enforces per-class assured goodput, defined as the committed rate of latency-compliant completions for each class.