华南腾飞企业AI应用推理性能加速与模型量化服务
vLLM/TensorRT-LLM加速,INT8/FP8量化,吞吐提升3-5倍。
服务概述
提供AI应用推理加速服务,基于vLLM与TensorRT-LLM深度优化推理引擎,实施FP8/INT8模型量化压缩,高并发吞吐提升3~5倍并显著降低首字延迟。
vLLM/TensorRT-LLM加速,INT8/FP8量化,吞吐提升3-5倍。
提供AI应用推理加速服务,基于vLLM与TensorRT-LLM深度优化推理引擎,实施FP8/INT8模型量化压缩,高并发吞吐提升3~5倍并显著降低首字延迟。