
IA locale — Vol.7
vLLM
Servir des modèles à haute performance pour plusieurs utilisateurs
9,99 €
epub · sans DRM · téléchargement immédiat
Édition papier (broché/relié) :
Plongez dans le monde du déploiement de modèles de langage à grande échelle avec ce guide pratique dédié à vLLM, la bibliothèque ouverte qui révolutionne l'inférence des LLMs. Que vous soyez ingénieur DevOps, data scientist ou architecte IA, ce livre vous fournit les connaissances nécessaires pour mettre en place un service de modèles performant, évolutif et sécurisé.
- Comprendre l'architecture interne de vLLM et ses avantages par rapport aux alternatives.
- Installer et configurer vLLM sur différents environnements matériels (CPU, GPU).
- Créer un environnement Python isolé et préparer les poids des modèles.
- Lancer un serveur de modèle unique et exploiter l'API compatible OpenAI.
- Servir plusieurs modèles simultanément et gérer des utilisateurs concurrents.
- Ajuster les paramètres de performance pour optimiser le débit et la latence.
- Appliquer la quantification (AWQ, GPTQ, etc.) pour réduire l'empreinte mémoire.
- Configurer tokenizer, paramètres d'échantillonnage et mise en cache des prompts.
- Mettre en place monitoring, logging et métriques pour une observabilité complète.
- Sécuriser le service avec authentification et contrôle d'accès.
- Conteneuriser avec Docker et déployer sur Kubernetes avec scaling automatique.
- Résoudre les problèmes courants et benchmarker vLLM face à d'autres solutions.
- Utiliser des fonctionnalités avancées comme le décodage spéculatif.
- Étudier un cas réel de création d'un service IA multi‑tenant.
En suivant les étapes détaillées, du choix du matériel à l'optimisation des paramètres de serveur, vous apprendrez à réduire la latence, augmenter le débit et garantir la disponibilité de vos modèles, même sous charge élevée. Vous découvrirez également comment containeriser votre solution avec Docker, l'orchestrer sur Kubernetes et mettre en place un équilibrage de charge automatisé pour un service multi‑tenant prêt à la production.