llama.cpp:基于 C/C++ 的 LLM 推理项目

可在多种硬件上实现 LLM 和 VLM 推理,支持本地与云端部署。核心功能包括多硬件架构优化、多精度量化、多后端支持及 CPU+GPU 混合推理,基于 ggml 库,追求低依赖与高性能。【此简介由AI生成】

分支684Tags7066

项目介绍

可在多种硬件上实现 LLM 和 VLM 推理,支持本地与云端部署。核心功能包括多硬件架构优化、多精度量化、多后端支持及 CPU+GPU 混合推理,基于 ggml 库,追求低依赖与高性能。【此简介由AI生成】

定制我的领域