Inference Llm

4 article(s)
1–4 sur 4
vLLM - 04. Provisioning GPU chez Infomaniak
vLLM - 04. Provisioning GPU chez Infomaniak
📖 Lire sur Vigie24

Cette vidéo présente la mise en œuvre du provisioning de GPU chez Infomaniak pour supporter vLLM. Elle détaille l'infrastructure nécessaire pour optimiser le déploiement et l'inférence de modèles de langage à grande échelle.

✍️ xavki · via  Xavki

France  · 31/08/2026 18:53 ·  ⚙️ 970 tok Score : 71.4 ⓘ

Notez :👁 1
vLLM - 02. L'inférence sans vLLM ? pytorch + transformer
vLLM - 02. L'inférence sans vLLM ? pytorch + transformer
📖 Lire sur Vigie24

Cette ressource explore la mise en œuvre de l'inférence de modèles de langage en utilisant PyTorch et la bibliothèque Transformers, sans recourir à vLLM. Elle permet de comprendre les mécanismes fondamentaux de l'exécution des modèles avant d'optimiser via des frameworks spécialisés.

✍️ xavki · via  Xavki

France  · 15/07/2026 19:41 ·  ⚙️ 631 tok Score : 59.8 ⓘ

Notez :👁 2
vLLM - 01. Introduction : C'est quoi ? (modèles, inférences, cache)
vLLM - 01. Introduction : C'est quoi ? (modèles, inférences, cache)
📖 Lire sur Vigie24

Cette introduction présente vLLM, une bibliothèque optimisée pour l'inférence de modèles de langage. Elle explique les concepts fondamentaux liés à la gestion du cache et à l'optimisation des ressources pour améliorer les performances de génération.

✍️ xavki · via  Xavki

France  · 05/07/2026 18:58 ·  ⚙️ 622 tok Score : 59.8 ⓘ

Notez :👁 2
v0.33.1-rc0: MLX: Qwen3.8 Flash Next support (#18032)
v0.33.1-rc0: MLX: Qwen3.8 Flash Next support (#18032)
📖 Lire sur Vigie24

La version v0.33.1-rc0 d'Ollama introduit le support du modèle Qwen3.8 Flash Next via le framework MLX. Cette mise à jour permet une meilleure intégration et exécution de ce modèle spécifique sur les architectures compatibles.

✍️ dhiltgen · via  Release notes from ollama

États-Unis  · 01/01/0001 00:00 ·  ⚙️ 988 tok Score : 48.4 ⓘ

Notez :👁 1
Une erreur s'est produite. Cette page ne sera pas actualisée jusqu'à ce que vous ayez redémarré l'application. Actualiser 🗙