四篇论文被DAC'2025接收
四篇关于高效大语言模型的论文被DAC'2025接收为正式论文。
四篇关于高效大语言模型的论文:
- HybriMoE: Hybrid CPU-GPU Scheduling and Cache Management for Efficient MoE Inference
- SpecASR: Accelerating LLM-based Automatic Speech Recognition via Speculative Decoding
- UniCAIM: A Unified CAM/CIM Architecture with Static-Dynamic KV Cache Pruning for Efficient Long-Context LLM Inference
- ReaLM: Reliable and Efficient Large Language Model Inference with Statistical Algorithm-Based Fault Tolerance