Jinda Jia

ML Systems · UC San Diego

Jinda Jia

Ph.D. student in Computer Science

I am a Ph.D. student at UC San Diego, advised by Prof. Dan Fu. My research focuses on efficient machine learning systems, especially the algorithms and systems behind large language model training and inference.

My work spans communication-efficient distributed training, quantization, and practical LLM serving.

Portrait of Jinda Jia

News

  • Sep 2026Began my Ph.D. in Computer Science at UC San Diego, advised by Prof. Dan Fu.
  • Apr 2026Released SAW-INT4, our work on 4-bit KV-cache quantization for LLM serving.
  • Sep 2025DUO was accepted to NeurIPS 2025.
  • Jun 2025STZ was accepted to SC 2025.

Selected Publications

  1. SAW-INT4: System-Aware 4-Bit KV-Cache Quantization for Real-World LLM Serving

    Jinda Jia, Jisen Li, Zhongzhu Zhou, Jung Hwan Heo, Jue Wang, Tri Dao, Shuaiwen Leon Song, Ben Athiwaratkun, Chenfeng Xu, Tianyi Zhang, Xiaoxia Wu

    arXiv preprint, 2026

    System-aware INT4 KV-cache quantization with block-diagonal Hadamard rotation for efficient LLM serving.

  2. DUO: No Compromise to Accuracy Degradation

    Jinda Jia, Cong Xie, Fanjiang Ye, Hao Feng, Hanlin Lu, Daoce Wang, Haibin Lin

    NeurIPS 2025

    Overlaps a high-precision gradient communication step with computation to retain accuracy under low-bit quantization.

  3. SDP4Bit: Toward 4-bit Communication Quantization in Sharded Data Parallelism for LLM Training

    Jinda Jia, Cong Xie, Hanlin Lu, Daoce Wang, Hao Feng, Chengming Zhang, Baixi Sun, Haibin Lin, Zhi Zhang, Xin Liu, Dingwen Tao

    NeurIPS 2024

    4-bit weight and gradient communication for efficient sharded LLM training.

  4. COMPSO: Optimizing Gradient Compression for Distributed Training with Second-Order Optimizers

    Baixi Sun, Weijin Liu, J. Gregory Pauloski, Jiannan Tian, Jinda Jia, Daoce Wang, Boyuan Zhang, Mingkai Zheng, Sheng Di, Sian Jin, Zhao Zhang, Xiaodong Yu, Kamil A. Iskra, Pete Beckman, Guangming Tan, Dingwen Tao

    PPoPP 2025

  5. BirdMoE: Reducing Communication Costs for Mixture-of-Experts Training Using Load-Aware Bi-random Quantization

    Donglei Wu, Weihao Yang, Xiangyu Zou, Jinda Jia, Dingwen Tao, Wen Xia, Zhihong Tian

    DAC 2025

  6. STZ: A High Quality and High Speed Streaming Lossy Compression Framework for Scientific Data

    Daoce Wang, Pascal Grosset, Jesus Pulido, Jiannan Tian, Tushar M. Athawale, Jinda Jia, Baixi Sun, Boyuan Zhang, Sian Jin, Kai Zhao, James Ahrens, Fengguang Song

    SC 2025

Experience

May–Jul 2026

Applied Deep Learning Research Intern · NVIDIA

Worked with Tijmen Blankevoort on NVFP4 quantization and expert-parallel communication quantization with NVFP4.

Oct 2025–May 2026

Research Intern · Together AI

Worked on KV-cache quantization in SGLang.

May–Aug 2025

Research Intern · ByteDance Seed Infra

Worked on hybrid LocalSGD-HSDP for hierarchical communication reduction.

Aug 2023–Jul 2026

Research Assistant · Indiana University Bloomington

Worked on communication compression for LLM training.

Jul 2020–Jul 2021

iOS Developer · Meituan

Background

2026–present

Ph.D. in Computer Science · UC San Diego

Advised by Prof. Dan Fu.

2024–2026

Ph.D. studies in Computer Engineering · Indiana University Bloomington

2021–2022

M.S. in Computer Science · University of Florida

2016–2020

B.S. in Software Engineering · Shandong University

Service: NeurIPS 2024 and 2025, ICML 2025 reviewer. Awards: University of Florida Graduate Academic Achievement Award; Indiana University Travel Award.