新闻

FineServe:全球 LLM 服务工作负载的细粒度数据集和特征

1 分钟阅读
来源:arXiv AI
arXiv:2607.19349v1 公告类型:新 摘要:大型语言模型 (LLM) 越来越多地部署为始终在线的在线服务,这使得高效的 LLM 服务成为一项关键的系统挑战。在需求波动的情况下实现低延迟和高吞吐量需要深入了解现实世界的服务工作负载,但现有的研究通常依赖于代理跟踪或粗粒度特征,而这些特征无法捕获现代多模型 LLM 平台的异构性。我们推出 FineServe,这是一个从全球商业市场收集的野外多模型 LLM 服务工作负载数据集,能够对跨异构模型的真实世界服务动态进行细粒度表征