Ollama : installer et utiliser un LLM local sur votre ordinateur, sans cloud – illustration Ollama & IA locale

Ollama : installer et utiliser un LLM local sur votre ordinateur, sans cloud

Thématique
IA générative & agents
Mis à jour
Lecture
12 min
Formation
Utiliser Ollama LLM : créer une IA locale

L'essentiel en 30 secondes

  • Ollama est un logiciel gratuit et open source qui permet de télécharger et d'exécuter des modèles de langage (LLM) directement sur votre ordinateur.
  • Avec une IA locale, vos prompts et vos documents ne quittent pas votre machine, ce qui garantit la confidentialité des données.
  • Trois commandes suffisent pour démarrer : ollama pull pour télécharger un modèle, ollama run pour discuter avec lui et ollama list pour voir les modèles installés.
  • Un Modelfile permet de créer un assistant sur mesure en fixant un message système, des paramètres et des exemples de dialogue.
  • Ollama se connecte à des interfaces comme Open WebUI, Msty, AnythingLLM ou l'extension Continue de VS Code pour un usage sans ligne de commande.
Sommaire de l'article
  1. Qu’est-ce qu’Ollama et une IA locale ?
  2. Pourquoi installer une IA locale avec Ollama ?
  3. Comment installer Ollama et lancer sa première IA : les étapes
  4. Quels modèles Ollama choisir selon vos besoins ?
  5. Personnaliser un modèle avec un Modelfile
  6. Utiliser Ollama avec d’autres outils
  7. Les erreurs fréquentes avec Ollama (et comment les éviter)
  8. Ollama vs IA en ligne : quelle solution choisir ?
  9. Comment apprendre à utiliser Ollama au quotidien ?
  10. En résumé

Ollama est un logiciel gratuit qui permet d’installer et de faire tourner une intelligence artificielle générative directement sur votre ordinateur, sans abonnement ni envoi de données dans le cloud. En une commande, vous téléchargez un modèle comme Mistral, Llama ou Gemma, et vous discutez avec lui comme avec ChatGPT, mais en local.

Ce guide s’adresse aux professionnels soucieux de confidentialité, aux développeurs et aux curieux qui veulent une IA locale sans se perdre dans la technique. Vous y apprendrez à installer Ollama, choisir un modèle adapté à votre machine, maîtriser les commandes essentielles, créer un assistant sur mesure avec un Modelfile et utiliser Ollama depuis des interfaces graphiques.

Qu’est-ce qu’Ollama et une IA locale ?

Ollama est un outil open source qui télécharge, gère et exécute des grands modèles de langage (LLM) sur votre propre matériel. Il fonctionne sur Windows, macOS et Linux, et expose une interface en ligne de commande, une application graphique et une API locale. Les modèles s’exécutent entièrement sur votre machine.

Une IA locale, ou LLM local, s’oppose aux services en ligne comme ChatGPT ou Claude : le modèle tourne sur votre ordinateur, vos questions et vos documents ne transitent par aucun serveur externe. Vous gagnez en confidentialité et en indépendance, au prix d’un modèle généralement moins puissant que les grands modèles du cloud et d’un besoin de mémoire vive.

Ollama simplifie ce qui était auparavant très technique : il choisit un format de modèle compressé (quantifié) adapté aux ordinateurs personnels, utilise automatiquement la carte graphique quand elle est compatible et gère le chargement en mémoire.

Pourquoi installer une IA locale avec Ollama ?

  • Confidentialité totale : contrats, données RH, dossiers clients ou code propriétaire restent sur votre poste.
  • Aucun abonnement : une fois le modèle téléchargé, vous l’utilisez sans limite ni coût d’API.
  • Fonctionnement hors ligne : en déplacement, sur un réseau isolé ou en cas de panne d’un service en ligne.
  • Personnalisation : message système, température, taille du contexte, exemples de dialogue, tout est réglable.
  • Intégration : l’API locale permet de brancher Ollama sur vos scripts, votre éditeur de code ou vos outils d’automatisation.
  • Apprentissage : comprendre concrètement comment fonctionne un LLM, ses limites et ses réglages.

Comment installer Ollama et lancer sa première IA : les étapes

Étape 1 — Vérifier votre matériel

La mémoire vive est le facteur limitant. Voici des ordres de grandeur pour des modèles quantifiés, tels qu’Ollama les propose par défaut :

Taille du modèleMémoire conseilléeUsage typique
1 à 4 milliards de paramètres8 Go de RAMRésumés simples, reformulation, tests
7 à 9 milliards de paramètres16 Go de RAMRédaction, assistance au code, analyse de textes
12 à 14 milliards de paramètres16 à 32 GoTâches plus complexes, meilleur français
30 milliards et plus32 Go et plus, GPU recommandéRaisonnement avancé, usage intensif

Une carte graphique NVIDIA ou AMD compatible, ou un Mac équipé d’une puce Apple Silicon, accélère fortement la génération. Sans GPU, Ollama utilise le processeur : cela fonctionne, mais les réponses arrivent plus lentement.

Étape 2 — Télécharger et installer Ollama

Rendez-vous sur le site officiel ollama.com et téléchargez l’installateur correspondant à votre système :

  • Windows : lancez l’installateur, puis ouvrez PowerShell ou le terminal.
  • macOS : glissez l’application dans le dossier Applications et lancez-la.
  • Linux : utilisez le script d’installation officiel.
curl -fsSL https://ollama.com/install.sh | sh

Vérifiez ensuite l’installation dans un terminal :

ollama --version

Si vous débutez avec le terminal sous Linux, notre guide pour apprendre Linux vous donnera les bases utiles (navigation, droits, gestion des services).

Étape 3 — Télécharger votre premier modèle

La bibliothèque de modèles est consultable sur le site d’Ollama. Chaque modèle a un nom et, souvent, des variantes de taille indiquées après deux-points. Téléchargez un modèle avec ollama pull :

ollama pull mistral
ollama pull llama3.2
ollama pull gemma3:4b

Puis listez les modèles installés :

ollama list

Notre conseil : commencez par un modèle de taille moyenne adapté à votre RAM, testez-le sur vos tâches réelles, puis essayez-en un ou deux autres pour comparer.

Étape 4 — Discuter avec le modèle en ligne de commande

Lancez une conversation avec ollama run :

ollama run mistral

Une invite >>> apparaît : tapez votre question et validez. Pour un texte sur plusieurs lignes, encadrez-le de trois guillemets """. Vous pouvez aussi poser une question unique sans entrer dans le mode interactif :

ollama run mistral "Propose trois objets d'e-mail pour relancer un devis non signé."

Étape 5 — Maîtriser les commandes du mode interactif

Dans une session ollama run, les commandes commencent par une barre oblique. Tapez /? pour afficher l’aide. Les plus utiles :

CommandeEffet
/set system "…"Définit le message système de la session
/set parameter temperature 0.3Rend les réponses plus stables et factuelles
/set parameter num_ctx 8192Augmente la taille du contexte (mémoire de la conversation)
/set verboseAffiche les statistiques de génération (vitesse, nombre de tokens)
/show infoAffiche les informations du modèle (taille, paramètres, licence)
/save mon-assistantEnregistre la session et ses réglages comme nouveau modèle
/load mon-assistantRecharge une session enregistrée
/clearEfface le contexte de la conversation
/byeQuitte la session

Exemple de réglage rapide pour un assistant de relecture :

>>> /set system "Tu es correcteur professionnel. Corrige l'orthographe et la grammaire du texte fourni, sans changer le style. Liste ensuite les corrections."
>>> /set parameter temperature 0.2
>>> /save correcteur

Étape 6 — Gérer vos modèles

Quelques commandes à connaître pour garder une installation propre :

ollama ps              # modèles actuellement chargés en mémoire
ollama show mistral    # détails d'un modèle
ollama stop mistral    # décharger un modèle de la mémoire
ollama rm gemma3:4b    # supprimer un modèle du disque

Les modèles occupent plusieurs gigaoctets chacun : supprimez ceux que vous n’utilisez plus.

Étape 7 — Utiliser l’application graphique

Sur Windows et macOS, l’application Ollama propose une fenêtre de discussion : vous choisissez le modèle dans une liste, tapez votre question et retrouvez vos conversations. Pour un usage quotidien sans terminal, c’est souvent suffisant. Pour des fonctions plus riches (documents, historique partagé, plusieurs utilisateurs), passez aux interfaces présentées plus bas.

Quels modèles Ollama choisir selon vos besoins ?

La bibliothèque d’Ollama compte de nombreux modèles, et de nouveaux arrivent chaque mois. Plutôt que de chercher « le meilleur », choisissez selon la tâche et votre matériel :

BesoinFamilles de modèles à testerConseil
Rédaction et reformulation en françaisMistral, Gemma, LlamaPréférez une taille moyenne pour un français naturel
Résumés rapides sur un ordinateur modestePetites variantes de Llama, Gemma ou QwenRapides, mais à vérifier sur les détails
Raisonnement, logique, mathématiquesModèles de raisonnement comme DeepSeek-R1 ou QwenPlus lents, car ils « réfléchissent » avant de répondre
Assistance à la programmationVariantes spécialisées en codeÀ connecter à VS Code avec Continue
Recherche dans des documents (RAG)Un modèle d’embeddings comme nomic-embed-text, plus un modèle de chatLe premier indexe, le second répond

Sur la page de chaque modèle, vérifiez trois informations : les tailles disponibles (pour votre RAM), la taille du contexte supportée et la licence, surtout pour un usage commercial. Testez ensuite deux candidats sur les mêmes prompts, tirés de vos tâches réelles, et gardez celui qui offre le meilleur compromis entre qualité et vitesse.

Personnaliser un modèle avec un Modelfile

Le Modelfile est un fichier texte qui décrit un modèle personnalisé : modèle de base, paramètres, message système et exemples. C’est la façon la plus propre de créer un assistant réutilisable.

Créez un fichier nommé Modelfile :

FROM mistral

PARAMETER temperature 0.3
PARAMETER num_ctx 8192

SYSTEM """
Tu es l'assistant RH d'une PME française. Tu réponds en français, avec des
phrases courtes et un ton bienveillant. Si une question dépasse le cadre du
droit du travail courant, tu recommandes de consulter un juriste.
"""

MESSAGE user Combien de jours de congés payés acquiert-on par mois ?
MESSAGE assistant En règle générale, 2,5 jours ouvrables par mois de travail effectif. Vérifiez toutefois votre convention collective.

Puis construisez et lancez le modèle :

ollama create assistant-rh -f Modelfile
ollama run assistant-rh

Les instructions principales :

  • FROM : le modèle de base (obligatoire).
  • PARAMETER : température, taille du contexte, etc.
  • SYSTEM : le message système, qui fixe le rôle et les règles.
  • MESSAGE : des exemples de dialogue qui guident le style des réponses.
  • TEMPLATE : le gabarit de mise en forme du prompt, à ne modifier que si vous savez ce que vous faites.

Pour afficher le Modelfile d’un modèle existant et vous en inspirer : ollama show mistral --modelfile.

Les principes d’un bon message système sont les mêmes que pour un prompt classique : rôle, contexte, contraintes, format. Notre guide sur l’écriture de prompts efficaces les détaille.

Utiliser Ollama avec d’autres outils

Ollama fonctionne en arrière-plan comme un serveur local, accessible à l’adresse http://localhost:11434. De nombreux logiciels savent s’y connecter.

Open WebUI, Msty et AnythingLLM

  • Open WebUI : une interface web complète, proche de ChatGPT, avec historique, gestion des modèles et import de documents. Elle s’installe notamment avec Python :
pip install open-webui
open-webui serve

L’interface est ensuite accessible dans votre navigateur, à l’adresse indiquée dans le terminal. Consultez la documentation du projet pour la version de Python requise et l’installation avec Docker.

  • Msty : une application de bureau qui détecte les modèles Ollama installés et permet de les comparer côte à côte.
  • AnythingLLM : une application orientée documents. Vous créez un espace de travail, importez vos fichiers, et le modèle Ollama y répond en s’appuyant sur leur contenu (RAG).

VS Code avec l’extension Continue

L’extension Continue pour Visual Studio Code transforme un modèle Ollama en assistant de programmation : explication de code, génération de fonctions, refactorisation. Il suffit de choisir Ollama comme fournisseur dans la configuration de l’extension et d’indiquer le modèle à utiliser.

L’API locale

Pour vos propres scripts, l’API répond en JSON :

curl http://localhost:11434/api/generate -d '{
  "model": "mistral",
  "prompt": "Résume en une phrase : Ollama exécute des LLM en local.",
  "stream": false
}'

C’est cette API qu’utilisent les frameworks comme LangChain. Si votre objectif est de construire un chatbot qui répond à partir de vos documents en Python, notre tutoriel RAG avec LangChain et Ollama vous guide pas à pas, de l’ingestion des fichiers au déploiement.

Les erreurs fréquentes avec Ollama (et comment les éviter)

ErreurCauseSolution
Réponses très lentesModèle trop gros pour la machine, exécution sur le processeurChoisir une variante plus petite, vérifier avec ollama ps que le GPU est utilisé
« model not found »Nom ou variante mal orthographiéVérifier avec ollama list, puis ollama pull le bon nom
Le modèle « oublie » le début d’un long documentContexte trop courtAugmenter num_ctx, en surveillant la mémoire
Réponses inventéesLimite de tout LLM, plus marquée sur les petits modèlesBaisser la température, fournir le texte source, vérifier les faits
Disque saturéAccumulation de modèlesollama rm sur les modèles inutilisés
Une interface ne trouve pas OllamaService arrêté ou mauvaise adresseLancer l’application Ollama ou ollama serve, vérifier localhost:11434
Réponses en anglaisModèle peu entraîné en français ou consigne absentePréciser « Réponds en français » dans le message système, tester un autre modèle

En formation, le problème le plus courant est le premier : vouloir le plus gros modèle possible. Un modèle plus petit mais rapide est souvent plus utile au quotidien qu’un grand modèle qui met une minute à répondre.

Ollama vs IA en ligne : quelle solution choisir ?

CritèreOllama (IA locale)ChatGPT, Claude, Gemini (cloud)
ConfidentialitéDonnées sur votre machineDonnées envoyées à l’éditeur
CoûtGratuit, hors matérielGratuit limité ou abonnement
Puissance des modèlesBonne à très bonne selon la tailleLes modèles les plus puissants du marché
Fonctionnement hors ligneOuiNon
Recherche web, génération d’imagesNon par défautOui, selon l’outil
Mise en routeInstallation et choix du modèleImmédiate
PersonnalisationTotale (Modelfile, paramètres, API)Limitée aux options proposées

Les deux approches se complètent : l’IA locale pour les données sensibles et les tâches répétitives, les services en ligne pour les tâches qui exigent la meilleure qualité possible. Pour comparer les assistants du cloud entre eux, consultez notre comparatif des IA génératives. Certains éditeurs, comme DeepSeek, publient aussi des modèles à poids ouverts que vous pouvez exécuter avec Ollama.

Comment apprendre à utiliser Ollama au quotidien ?

Voici le parcours que nous recommandons pour devenir autonome :

  1. Première heure : installer Ollama, télécharger deux modèles, discuter en ligne de commande et découvrir l’application graphique.
  2. Deuxième heure : maîtriser les commandes interactives (/set, /show, /save, /load), régler température et contexte, rédiger de bons prompts.
  3. Troisième heure : créer un Modelfile avec message système et exemples, puis connecter Ollama à Open WebUI, Msty, VS Code ou AnythingLLM.
  4. Ensuite : remplacer progressivement certaines tâches confiées aux IA en ligne par votre assistant local, en particulier celles qui touchent des données sensibles.

Pour suivre ce parcours avec un formateur, la formation Ollama pour créer une IA locale d’EspritAcadémique dure deux heures quarante-cinq et ne demande aucun prérequis. Elle couvre notamment :

  • l’installation d’Ollama, le téléchargement des modèles et le dialogue en ligne de commande ou via l’interface graphique ;
  • les commandes interactives pour régler une session, ajuster les paramètres, afficher les informations d’un modèle, sauvegarder et restaurer ;
  • les bonnes pratiques de prompt, le rôle du message système, l’itération et la vérification des réponses face aux hallucinations ;
  • la création de Modelfiles avec MESSAGE et TEMPLATE pour personnaliser un modèle ;
  • l’utilisation d’Ollama avec Msty, Open WebUI, VS Code et l’extension Continue ;
  • la création d’un assistant documentaire avec AnythingLLM grâce au RAG.

En résumé

Ollama rend l’IA locale accessible à tous : une installation, trois commandes (ollama pull, ollama run, ollama list) et vous disposez d’un assistant confidentiel, gratuit et utilisable hors ligne. Choisissez un modèle adapté à votre mémoire vive, réglez-le avec les commandes interactives ou un Modelfile, puis branchez-le sur une interface graphique ou votre éditeur de code. Gardez les IA du cloud pour les tâches qui exigent la puissance maximale.

Questions fréquentes

Est-ce que Ollama est gratuit ?

Oui. Ollama est un logiciel open source, gratuit, disponible sur Windows, macOS et Linux. Les modèles de sa bibliothèque sont également téléchargeables gratuitement, chacun sous sa propre licence, qu'il faut vérifier pour un usage commercial. Le seul coût réel est matériel : un ordinateur disposant de suffisamment de mémoire vive, et idéalement d'une carte graphique compatible, pour faire tourner les modèles confortablement.

Quelle configuration faut-il pour faire tourner Ollama ?

Pour les petits modèles de 1 à 4 milliards de paramètres, un ordinateur récent avec 8 Go de RAM suffit. Comptez plutôt 16 Go pour les modèles d'environ 7 à 8 milliards de paramètres, et 32 Go ou plus au-delà. Une carte graphique NVIDIA ou AMD compatible, ou une puce Apple Silicon, accélère fortement les réponses. Sans GPU, Ollama fonctionne sur le processeur, mais plus lentement.

Ollama fonctionne-t-il sans connexion Internet ?

Oui, une fois les modèles téléchargés. La connexion n'est nécessaire que pour installer Ollama et récupérer un modèle avec ollama pull. Ensuite, toute la génération se fait sur votre machine : vous pouvez discuter avec le modèle en avion ou sur un réseau isolé. C'est l'un des principaux intérêts d'une IA locale pour les données sensibles.

Quel est le meilleur modèle Ollama en français ?

Il n'y a pas de réponse unique, car la bibliothèque évolue sans cesse. Les modèles de Mistral AI, entreprise française, sont un bon point de départ pour le français. Les familles Llama, Gemma et Qwen donnent aussi de bons résultats selon la taille choisie. La meilleure méthode consiste à tester deux ou trois modèles sur vos propres tâches et à garder celui qui répond le mieux dans des délais acceptables.

Peut-on utiliser Ollama avec ses propres documents ?

Oui, grâce au RAG (génération augmentée par la recherche). Des interfaces comme AnythingLLM ou Open WebUI permettent d'importer des documents et de les interroger avec un modèle Ollama, sans écrire de code. Pour construire votre propre chatbot documentaire en Python, il faut passer par un framework comme LangChain, qui se connecte à Ollama.

Combien de temps faut-il pour prendre en main Ollama ?

Une demi-heure suffit pour installer Ollama, télécharger un premier modèle et discuter avec lui. Comptez trois heures environ pour maîtriser les commandes interactives, les paramètres, le Modelfile et la connexion à des interfaces graphiques. L'intégration dans votre travail quotidien, avec le bon modèle pour chaque tâche, se construit ensuite en quelques semaines d'usage.