Inference Llm
4 article(s)
vLLM - 04. Provisioning GPU chez Infomaniak
📖 Lire sur Vigie24Cette vidéo présente la mise en œuvre du provisioning de GPU chez Infomaniak pour supporter vLLM. Elle détaille l'infrastructure nécessaire pour optimiser le déploiement et l'inférence de modèles de langage à grande échelle.

vLLM - 02. L'inférence sans vLLM ? pytorch + transformer
📖 Lire sur Vigie24Cette ressource explore la mise en œuvre de l'inférence de modèles de langage en utilisant PyTorch et la bibliothèque Transformers, sans recourir à vLLM. Elle permet de comprendre les mécanismes fondamentaux de l'exécution des modèles avant d'optimiser via des frameworks spécialisés.

vLLM - 01. Introduction : C'est quoi ? (modèles, inférences, cache)
📖 Lire sur Vigie24Cette introduction présente vLLM, une bibliothèque optimisée pour l'inférence de modèles de langage. Elle explique les concepts fondamentaux liés à la gestion du cache et à l'optimisation des ressources pour améliorer les performances de génération.
v0.33.1-rc0: MLX: Qwen3.8 Flash Next support (#18032)
📖 Lire sur Vigie24La version v0.33.1-rc0 d'Ollama introduit le support du modèle Qwen3.8 Flash Next via le framework MLX. Cette mise à jour permet une meilleure intégration et exécution de ce modèle spécifique sur les architectures compatibles.