Volume: Vol-4275 SuRE 2026 |
Year: 2026
Paper: « paper9 | paper13 | paper10 »
CompressKV: Semantic-Retrieval-Guided KV-Cache Compression for Resource-Efficient Long-Context LLM Inference
- Xiaolin Lin
- Jingcun Wang
- Olga Kondrateva
- Yiyu Shi
- Bing Li
- Grace Li Zhang
PDF