La taille de modèle adaptée à ta machine : 8B pour du léger, 70B pour du sérieux, 405B pour du cloud dédié.
HERMES/AGENT
Un modèle de langage à poids ouverts, taillé pour appeler des outils plutôt que pour réciter poliment. Hermes de Nous Research tourne sur ta machine, répond à ton system prompt, et ne demande la permission à aucun cloud pour agir.
entrer dans le node ↓HERMES_01
Un LLM pensé pour agir, pas juste pour discuter.
Hermes est une famille de modèles publiée par Nous Research, un collectif de recherche indépendant connu pour ses fine-tunes en poids ouverts sur des bases comme Llama et Mistral. Sa spécialité : le function calling natif, un format de sortie structuré (JSON) fiable, et un system prompt qui se comporte vraiment comme une instruction, pas comme une simple suggestion noyée sous des couches de sécurité corporate.
Ollama, LM Studio ou llama.cpp pour charger les poids en local, sans compte ni connexion obligatoire.
Définir des fonctions/outils dans le system prompt pour que le modèle appelle du code réel, pas juste du texte.
Brancher l'agent sur autre chose que du chat : domotique, scripts, traitement de documents privés.
MODELES_02
"Hermes" désigne plusieurs générations de modèles.
Chaque version part d'un modèle de base différent et vise un compromis différent entre taille, qualité et matériel nécessaire. La bonne version dépend surtout de ce que ta machine peut faire tourner.
Hermes 3 (405B)
Basé sur Llama 3.1 405B, le haut du panier de la famille. Réservé au cloud ou à des clusters GPU dédiés.
Hermes 3 (70B)
Le meilleur compromis qualité/matériel pour qui a une machine musclée ou plusieurs GPU grand public.
Hermes 3 (8B)
Tient sur une seule carte grand public quantifiée, idéal pour découvrir le function calling sans grosse machine.
Hermes 2 Pro
Génération précédente basée sur Llama 3 8B, déjà solide en function calling et en sortie JSON structurée.
Nouvelles versions régulières : Nous Research publie fréquemment de nouvelles itérations. Le dépôt Hugging Face du collectif reste la source la plus à jour.
huggingface.co/NousResearch →FUNCTION_CALLING_03
Ce qui distingue vraiment un "agent" d'un chatbot.
Un chatbot classique décrit ce qu'il ferait. Un modèle Hermes correctement outillé appelle réellement une fonction, avec des arguments structurés que ton code peut exécuter. Le modèle est entraîné à produire ce format nativement, sans bidouille de prompt.
// Le modèle reçoit la définition d'un outil dans le system prompt
tools = [{
name: "get_weather",
description: "Renvoie la météo pour une ville",
parameters: { city: "string" }
}]
// La réponse du modèle contient un appel structuré, pas du texte libre
<tool_call>
{ "name": "get_weather", "arguments": { "city": "Lyon" } }
</tool_call>
// Ton code exécute réellement get_weather("Lyon")
// et renvoie le résultat au modèle pour qu'il continue
LOGICIELS_04
Comment le faire tourner concrètement.
Pas besoin d'un datacenter pour commencer. Les versions quantifiées (GGUF) rendent Hermes accessible à une machine de bureau correcte.
Ollama
La façon la plus simple de lancer un modèle Hermes : une commande, et le serveur local tourne, prêt pour tes scripts.
ollama.com ↗LM Studio
Télécharger, quantifier et discuter avec un modèle GGUF via une interface graphique, sans terminal.
lmstudio.ai ↗llama.cpp
Le moteur d'inférence bas niveau derrière une bonne partie de l'écosystème local, format GGUF, CPU ou GPU.
github.com/llama.cpp ↗vLLM
Serving haute performance pour de multiples requêtes concurrentes, pensé pour un usage plus intensif qu'un chat perso.
github.com/vllm ↗Nous Research
Le collectif derrière Hermes : annonces, recherche et liens vers l'ensemble de leurs projets ouverts.
nousresearch.com ↗GitHub Nous Research
Outils, scripts d'entraînement et ressources techniques publiés par le collectif.
github.com/NousResearch ↗USAGES_05
Ce qu'on branche derrière un agent local.
Le function calling n'a d'intérêt que si quelque chose écoute derrière. Voici les usages qui reviennent le plus souvent.
Contrôle vocal local
Piloter Home Assistant en langage naturel via des appels de fonction, sans qu'une phrase parte vers un cloud tiers.
Assistant de code local
Autocomplétion et refactoring sans envoyer une ligne de code propriétaire à un service tiers.
RAG sur documents privés
Interroger ses propres fichiers (factures, contrats, notes) sans qu'ils ne quittent jamais la machine.
Automatisation système
Un agent qui déclenche de vrais scripts (sauvegarde, tri de fichiers, rapports) sur commande en langage naturel.
Écriture & roleplay
Un system prompt qui est vraiment respecté, utile pour des personnages ou des styles d'écriture cohérents.
Backend d'agent maison
Servir le modèle via vLLM/Ollama comme brique de base d'une application ou d'un bot interne.
Envie de connecter l'agent à ta maison ? Le module Home Assistant détaille l'intégration domotique locale que ce genre d'agent peut piloter.
Voir le module Home Assistant →MATOS_06
Ce qu'il faut vraiment pour le faire tourner.
La VRAM est le vrai facteur limitant, bien avant la puissance du processeur. Un modèle quantifié divise largement les besoins par rapport à la précision d'origine.
GPU 24 Go (RTX 3090/4090)
Point d'entrée sérieuxFait tourner Hermes 8B en pleine précision ou des 70B quantifiés agressivement.
Mac Apple Silicon (M2/M3/M4)
Mémoire unifiéeLa RAM partagée CPU/GPU permet de charger des modèles plus gros qu'une carte grand public équivalente.
64 Go de RAM système
Offload CPUUtile pour compléter la VRAM quand le modèle ne tient pas entièrement sur le GPU.
SSD NVMe rapide
ChargementLes poids pèsent de quelques Go à plusieurs dizaines de Go : un disque lent ralentit chaque démarrage.
Multi-GPU ou location cloud
Pour le 70B/405BAu-delà d'une carte grand public, la location ponctuelle (RunPod, Vast.ai) reste souvent plus rentable qu'un achat.
Alimentation & refroidissement
Sous-estiméUne inférence prolongée sollicite le GPU en continu : une alim correcte et un boîtier bien ventilé évitent le throttling.
CONSEILS_07
Ce qui évite de perdre une soirée à débugger un prompt.
Avertissement de conformité poids ouverts
Il est possible qu'en lisant cette page vous développiez certains comportements statistiquement préoccupants pour BagshitterCorp™ et son département IA sur abonnement mensuel.
- Faire tourner un modèle de langage sans connexion internet.
- Écrire un system prompt plus soigné qu'un rapport de stage.
- Refuser de payer un abonnement pour poser une question à une IA.
- Débugger un appel de fonction JSON à minuit passé.
- Préférer un modèle qui répond vraiment à un modèle qui s'excuse.
- Calculer combien de VRAM il manque pour la prochaine taille de modèle.
- Expliquer la différence entre GGUF et safetensors sans qu'on ait rien demandé.
- Considérer qu'un poids de modèle téléchargé une fois reste acquis pour toujours.
Le modèle. Le prompt. Ta machine.
Un agent local n'est pas magique : il demande du matos, un peu de configuration, et des outils bien définis. Mais chaque requête qui reste chez toi est une requête qui n'a rien à voir avec le business model de quelqu'un d'autre.