Vllm
2 article(s)
→

vLLM - 04. Provisioning GPU chez Infomaniak
📖 Lire sur Vigie24Cette vidéo présente la mise en œuvre du provisioning de GPU chez Infomaniak pour supporter vLLM. Elle détaille l'infrastructure nécessaire pour optimiser le déploiement et l'inférence de modèles de langage à grande échelle.
Notez :👁 1

vLLM - 01. Introduction : C'est quoi ? (modèles, inférences, cache)
📖 Lire sur Vigie24Cette introduction présente vLLM, une bibliothèque optimisée pour l'inférence de modèles de langage. Elle explique les concepts fondamentaux liés à la gestion du cache et à l'optimisation des ressources pour améliorer les performances de génération.
Notez :👁 2