<sebastien.techno/>
← retour au catalogue
llama.cpp

IA locale — Vol.6

llama.cpp

Exécuter et optimiser des modèles quantifiés sur CPU et GPU

9,99 €

epub · sans DRM · téléchargement immédiat

Ce volume vous guide pas à pas dans le déploiement de llama.cpp, la bibliothèque d'inférence légère et performante pour les grands modèles de langage. Vous apprendrez à préparer votre environnement, à convertir et quantifier vos modèles, puis à les exécuter efficacement sur CPU et GPU grâce aux différents backends (Vulkan, Metal, CUDA). Grâce à des exemples concrets et des meilleures pratiques, vous serez capable d'intégrer llama.cpp dans des applications réelles, de créer une API serveur avec FastAPI et de l'utiliser avec des interfaces telles qu'Open WebUI. **Ce que vous maîtriserez à la fin du livre :** - Installation et configuration de l'environnement de développement pour llama.cpp - Téléchargement, conversion et quantification des modèles au format GGUF - Inférence de base et optimisation avancée sur CPU - Utilisation des backends GPU : Vulkan, Metal, CUDA - Construction de llama.cpp avec support GPU et réglage des performances - Gestion de la mémoire : KV cache, split mode et offloading - Benchmarking et profiling des performances - Intégration avec Python, création d'une API FastAPI et utilisation avec Open WebUI - Gestion avancée des prompts, support LoRA et distribution de modèles quantifiés - Considérations de sécurité, de modération et de portabilité multiplateforme