Book
Open access
Aug 2026
Rate-Assured GPU Inference for 5G AI Slices
This work designs a GPU scheduler that combines Hierarchical Token Bucket-based traffic conditioning with Earliest Deadline First scheduling and enforces per-class assured goodput, defined as the committed rate of latency-compliant completions for each class.
Yu-Hong Shen, Wen-Ju Chiang, Hsiang-Ming Hung et al.
· Conference on Applications,... · 0 citations