Published Conference/Journal Papers
Technical Reports
Unpublished High-Impact Papers
- arXivAkashic: A Low-Overhead LLM Inference Service with MemAttentionarXiv preprint arXiv:2607.05708, 2026
- arXivS-HPLB: Efficient LLM Attention Serving via Sparsity-Aware Head Parallelism Load BalancearXiv preprint arXiv:2603.10353, 2026
- arXivSageSched: Efficient LLM Scheduling Confronting Demand Uncertainty and HybridityarXiv preprint arXiv:2603.07917, 2026
- arXivJustitia: Fair and Efficient Scheduling of Task-parallel LLM Agents with Selective PamperingarXiv preprint arXiv:2510.17015, 2025
- arXivEfficient Unified Caching for Accelerating Heterogeneous AI WorkloadsarXiv preprint arXiv:2506.12370, 2025