Published Conference/Journal Papers

  1. ATC (CCF-A)
    HAPIC: Position-Independent Caching for Hybrid-Attention LLM Serving
    Yifei Liu, Juntong Wu, Yang Liu, Junhao Hu, Minghao Li, Xiaoxu Chen, and Weihang Chen
    ACM SIGOPS Annual Technical Conference, 2026
  2. TACO (CCF-A)
    Hermes: Efficient Serving of LLM Applications with Probabilistic Demand Modeling
    Yifei Liu, Zuo Gan, Zhenghao Gan, Weiye Wang, Chen Chen, Yizhou Shan, Xusheng Chen, Zhenhua Han, Yifei Zhu, Shixuan Sun, and Minyi Guo
    ACM Transactions on Architecture and Code Optimization, 2026
  3. TACO (CCF-A)
    Ares: Fair and Efficient Scheduling of Deep Learning Jobs with Elastic Fair Queuing
    Yifei Liu, Chen Chen, Qiang Wang, Yu Feng, Weihao Cui, Quan Chen, and Minyi Guo
    ACM Transactions on Architecture and Code Optimization, 2025

Technical Reports

  1. arXiv
    RedKnot-MLA: Multi-Head Offline-Online Reuse for DeepSeek-V4 Long-Context Serving
    Yang Liu, Zhaokai Luo, Huayi Jin, Ruozhou He, Chenchen Hong, Mingxiao Ma, Biao Zhang, Zhiyong Wang, Boyu Wang, Guanjie Chen, Yifei Liu, Tao Xie, and Junhao Hu
    arXiv preprint arXiv:2609.07008, 2026

Unpublished High-Impact Papers

  1. arXiv
    ExFold: Unified Expert Folding for Training-Free MoE Prefill-Decode Acceleration
    Juntong Wu, Yifei Liu, Junyi Chen, Siqi Fan, Chaoran Feng, Minghao Li, Liujie Zhang, Weihang Chen, and Li Yuan
    arXiv preprint arXiv:2608.24938, 2026
  2. arXiv
    GDPevo: Evaluating Agent Self-Evolution on Real Business Tasks
    Leijun Zhou, Zhihao Liu, Xiang Qu, Chenxu Liu, Yifei Liu, Yanke Yu, Jingzhe Xu, Xuejun Wu, Buyue Qian, Xi Chen, Yaowei Zheng, and Junhao Hu
    arXiv preprint arXiv:2608.03764, 2026
  3. arXiv
    Akashic: A Low-Overhead LLM Inference Service with MemAttention
    Yang Liu, Zhaokai Luo, Huayi Jin, Ruozhou He, Chenchen Hong, Zhiyong Wang, Yifei Liu, Yunfei Gu, Chentao Wu, and Junhao Hu
    arXiv preprint arXiv:2607.05708, 2026
  4. arXiv
    S-HPLB: Efficient LLM Attention Serving via Sparsity-Aware Head Parallelism Load Balance
    Di Liu, Yifei Liu, Chen Chen, Zhibin Yu, Xiaoyi Fan, Quan Chen, and Minyi Guo
    arXiv preprint arXiv:2603.10353, 2026
  5. arXiv
    SageSched: Efficient LLM Scheduling Confronting Demand Uncertainty and Hybridity
    Zhenghao Gan, Yichen Bao, Yifei Liu, Chen Chen, Quan Chen, and Minyi Guo
    arXiv preprint arXiv:2603.07917, 2026
  6. arXiv
    Justitia: Fair and Efficient Scheduling of Task-parallel LLM Agents with Selective Pampering
    Mingyan Yang, Guanjie Wang, Manqi Luo, Yifei Liu, Chen Chen, Han Zhao, Yu Feng, Quan Chen, and Minyi Guo
    arXiv preprint arXiv:2510.17015, 2025
  7. arXiv
    Efficient Unified Caching for Accelerating Heterogeneous AI Workloads
    Tianze Wang, Yifei Liu, Chen Chen, Pengfei Zuo, Jiawei Zhang, Qizhen Weng, Yin Chen, Zhenhua Han, Jieru Zhao, Quan Chen, and Minyi Guo
    arXiv preprint arXiv:2506.12370, 2025