Published Conference/Journal Papers
- NeurIPS (CCF-A)SageSched: Efficient LLM Scheduling Confronting Demand Uncertainty and HybridityAdvances in Neural Information Processing Systems, 2026
- NeurIPS (CCF-A)Justitia: Fair and Efficient Scheduling of Task-parallel LLM Agents with Selective PamperingAdvances in Neural Information Processing Systems, 2026
Technical Reports
Unpublished High-Impact Papers
- arXivAkashic: A Low-Overhead LLM Inference Service with MemAttentionarXiv preprint arXiv:2607.05708, 2026
- arXivS-HPLB: Efficient LLM Attention Serving via Sparsity-Aware Head Parallelism Load BalancearXiv preprint arXiv:2603.10353, 2026
- arXivEfficient Unified Caching for Accelerating Heterogeneous AI WorkloadsarXiv preprint arXiv:2506.12370, 2025