serving-llms-vllm
用 vLLM 做高吞吐 LLM 服务:OpenAI 兼容 API、量化优化。适合部署生产环境模型服务、多用户并发、推理性能优化。
技能介绍
用 vLLM 做高吞吐 LLM 服务:OpenAI 兼容 API、量化优化。适合部署生产环境模型服务、多用户并发、推理性能优化。
适用对象
适合需要mlops能力、并希望先了解条目用途再决定是否安装的技能用户。
资料中明确的能力与使用场景
- 用 vLLM 做高吞吐 LLM 服务:OpenAI 兼容 API、量化优化
- 适合部署生产环境模型服务、多用户并发、推理性能优化
- vLLM: high-throughput LLM serving, OpenAI API, quantization
详细说明
vLLM: high-throughput LLM serving, OpenAI API, quantization.
分类与标签
分类:mlops · mlops
相关入口
限制与注意事项
当前条目资料未提供独立的版本兼容性、参数表或完整测试报告;未列出的系统、依赖、权限与功能边界,请以官方入口的 README 和实际环境为准。