Chargement des poids du modèle...
710://NODE-HERMES
Module 710HUB // L'agent IA qui tourne chez toi

HERMES/AGENT

Un modèle de langage à poids ouverts, taillé pour appeler des outils plutôt que pour réciter poliment. Hermes de Nous Research tourne sur ta machine, répond à ton system prompt, et ne demande la permission à aucun cloud pour agir.

entrer dans le node ↓
710://HUB
HERMES_01

Un LLM pensé pour agir, pas juste pour discuter.

Hermes est une famille de modèles publiée par Nous Research, un collectif de recherche indépendant connu pour ses fine-tunes en poids ouverts sur des bases comme Llama et Mistral. Sa spécialité : le function calling natif, un format de sortie structuré (JSON) fiable, et un system prompt qui se comporte vraiment comme une instruction, pas comme une simple suggestion noyée sous des couches de sécurité corporate.

Poids ouverts Nous Research Function calling JSON structuré Base Llama / Mistral Local-first System prompt steerable ChatML GGUF Agentic Auto-hébergé Sans clé API
Choisir

La taille de modèle adaptée à ta machine : 8B pour du léger, 70B pour du sérieux, 405B pour du cloud dédié.

Faire tourner

Ollama, LM Studio ou llama.cpp pour charger les poids en local, sans compte ni connexion obligatoire.

Outiller

Définir des fonctions/outils dans le system prompt pour que le modèle appelle du code réel, pas juste du texte.

Automatiser

Brancher l'agent sur autre chose que du chat : domotique, scripts, traitement de documents privés.

710://HUB
MODELES_02

"Hermes" désigne plusieurs générations de modèles.

Chaque version part d'un modèle de base différent et vise un compromis différent entre taille, qualité et matériel nécessaire. La bonne version dépend surtout de ce que ta machine peut faire tourner.

MODEL // 01 ● PHARE

Hermes 3 (405B)

Basé sur Llama 3.1 405B, le haut du panier de la famille. Réservé au cloud ou à des clusters GPU dédiés.

Llama 3.1 Cloud/cluster Haut de gamme
MODEL // 02 ● ÉQUILIBRÉ

Hermes 3 (70B)

Le meilleur compromis qualité/matériel pour qui a une machine musclée ou plusieurs GPU grand public.

Llama 3.1 Multi-GPU Sérieux
MODEL // 03 ● ACCESSIBLE

Hermes 3 (8B)

Tient sur une seule carte grand public quantifiée, idéal pour découvrir le function calling sans grosse machine.

Llama 3.1 GPU unique Point d'entrée
MODEL // 04 ● HISTORIQUE

Hermes 2 Pro

Génération précédente basée sur Llama 3 8B, déjà solide en function calling et en sortie JSON structurée.

Llama 3 Function calling Éprouvé

Nouvelles versions régulières : Nous Research publie fréquemment de nouvelles itérations. Le dépôt Hugging Face du collectif reste la source la plus à jour.

huggingface.co/NousResearch →
710://HUB
FUNCTION_CALLING_03

Ce qui distingue vraiment un "agent" d'un chatbot.

Un chatbot classique décrit ce qu'il ferait. Un modèle Hermes correctement outillé appelle réellement une fonction, avec des arguments structurés que ton code peut exécuter. Le modèle est entraîné à produire ce format nativement, sans bidouille de prompt.

exemple // appel de fonction
// Le modèle reçoit la définition d'un outil dans le system prompt
tools = [{
  name: "get_weather",
  description: "Renvoie la météo pour une ville",
  parameters: { city: "string" }
}]

// La réponse du modèle contient un appel structuré, pas du texte libre
<tool_call>
{ "name": "get_weather", "arguments": { "city": "Lyon" } }
</tool_call>

// Ton code exécute réellement get_weather("Lyon")
// et renvoie le résultat au modèle pour qu'il continue
710://HUB
LOGICIELS_04

Comment le faire tourner concrètement.

Pas besoin d'un datacenter pour commencer. Les versions quantifiées (GGUF) rendent Hermes accessible à une machine de bureau correcte.

Débutant

Ollama

La façon la plus simple de lancer un modèle Hermes : une commande, et le serveur local tourne, prêt pour tes scripts.

ollama.com ↗
Interface

LM Studio

Télécharger, quantifier et discuter avec un modèle GGUF via une interface graphique, sans terminal.

lmstudio.ai ↗
Moteur

llama.cpp

Le moteur d'inférence bas niveau derrière une bonne partie de l'écosystème local, format GGUF, CPU ou GPU.

github.com/llama.cpp ↗
Production

vLLM

Serving haute performance pour de multiples requêtes concurrentes, pensé pour un usage plus intensif qu'un chat perso.

github.com/vllm ↗
Source

Nous Research

Le collectif derrière Hermes : annonces, recherche et liens vers l'ensemble de leurs projets ouverts.

nousresearch.com ↗
Code

GitHub Nous Research

Outils, scripts d'entraînement et ressources techniques publiés par le collectif.

github.com/NousResearch ↗
710://HUB
USAGES_05

Ce qu'on branche derrière un agent local.

Le function calling n'a d'intérêt que si quelque chose écoute derrière. Voici les usages qui reviennent le plus souvent.

USAGE // 01 ● DOMOTIQUE

Contrôle vocal local

Piloter Home Assistant en langage naturel via des appels de fonction, sans qu'une phrase parte vers un cloud tiers.

USAGE // 02 ● DEV

Assistant de code local

Autocomplétion et refactoring sans envoyer une ligne de code propriétaire à un service tiers.

USAGE // 03 ● DOCUMENTS

RAG sur documents privés

Interroger ses propres fichiers (factures, contrats, notes) sans qu'ils ne quittent jamais la machine.

USAGE // 04 ● SCRIPTS

Automatisation système

Un agent qui déclenche de vrais scripts (sauvegarde, tri de fichiers, rapports) sur commande en langage naturel.

USAGE // 05 ● CRÉATIF

Écriture & roleplay

Un system prompt qui est vraiment respecté, utile pour des personnages ou des styles d'écriture cohérents.

USAGE // 06 ● API PERSO

Backend d'agent maison

Servir le modèle via vLLM/Ollama comme brique de base d'une application ou d'un bot interne.

Envie de connecter l'agent à ta maison ? Le module Home Assistant détaille l'intégration domotique locale que ce genre d'agent peut piloter.

Voir le module Home Assistant →
710://HUB
MATOS_06

Ce qu'il faut vraiment pour le faire tourner.

La VRAM est le vrai facteur limitant, bien avant la puissance du processeur. Un modèle quantifié divise largement les besoins par rapport à la précision d'origine.

GPU 24 Go (RTX 3090/4090)

Point d'entrée sérieux

Fait tourner Hermes 8B en pleine précision ou des 70B quantifiés agressivement.

Mac Apple Silicon (M2/M3/M4)

Mémoire unifiée

La RAM partagée CPU/GPU permet de charger des modèles plus gros qu'une carte grand public équivalente.

64 Go de RAM système

Offload CPU

Utile pour compléter la VRAM quand le modèle ne tient pas entièrement sur le GPU.

SSD NVMe rapide

Chargement

Les poids pèsent de quelques Go à plusieurs dizaines de Go : un disque lent ralentit chaque démarrage.

Multi-GPU ou location cloud

Pour le 70B/405B

Au-delà d'une carte grand public, la location ponctuelle (RunPod, Vast.ai) reste souvent plus rentable qu'un achat.

Alimentation & refroidissement

Sous-estimé

Une inférence prolongée sollicite le GPU en continu : une alim correcte et un boîtier bien ventilé évitent le throttling.

710://HUB
CONSEILS_07

Ce qui évite de perdre une soirée à débugger un prompt.

Respecter le template ChatML exact du modèle Quantization Q4_K_M en bon compromis qualité/taille Q8 ou pleine précision si la VRAM le permet Ne pas mélanger prompt Hermes et format Llama de base Tester le function calling avec un vrai schéma JSON Étendre le contexte via YaRN si besoin de longs documents Surveiller la VRAM (nvidia-smi / nvtop) pendant l'inférence Versionner ses system prompts comme du vrai code

Avertissement de conformité poids ouverts

Il est possible qu'en lisant cette page vous développiez certains comportements statistiquement préoccupants pour BagshitterCorp™ et son département IA sur abonnement mensuel.

  • Faire tourner un modèle de langage sans connexion internet.
  • Écrire un system prompt plus soigné qu'un rapport de stage.
  • Refuser de payer un abonnement pour poser une question à une IA.
  • Débugger un appel de fonction JSON à minuit passé.
  • Préférer un modèle qui répond vraiment à un modèle qui s'excuse.
  • Calculer combien de VRAM il manque pour la prochaine taille de modèle.
  • Expliquer la différence entre GGUF et safetensors sans qu'on ait rien demandé.
  • Considérer qu'un poids de modèle téléchargé une fois reste acquis pour toujours.
Ces symptômes ne sont couverts par aucune limite de tokens mensuelle.
X!//LOCAL_INFERENCE_STARTED_WITHOUT_APPROVAL

Le modèle. Le prompt. Ta machine.

Un agent local n'est pas magique : il demande du matos, un peu de configuration, et des outils bien définis. Mais chaque requête qui reste chez toi est une requête qui n'a rien à voir avec le business model de quelqu'un d'autre.

710HUB://HERMES_NODE / LOAD / PROMPT / CALL / KEEP_YOUR_TOKENS_LOCAL
Bienvenue bro.
← Retour au 710HUB →