Intelligence artificielle Tutoriel

Installer une IA en local sur son PC avec Ollama (gratuit et privé)

Faire tourner un modèle d'IA directement sur votre ordinateur avec Ollama : installation, commandes essentielles, matériel nécessaire et limites.

Sommaire8 parties
  1. Pourquoi utiliser une IA en local ?
  2. Quel matériel faut-il ?
  3. Étape 1 : installer Ollama
  4. Étape 2 : télécharger et lancer un modèle
  5. Les commandes essentielles
  6. Étape 3 (bonus) : utiliser l’API locale
  7. Les limites à connaître
  8. En résumé

ChatGPT, Claude ou Gemini fonctionnent sur les serveurs de leurs éditeurs : vos questions et vos documents y sont envoyés. Il existe une alternative : faire tourner un modèle d’IA directement sur votre ordinateur, sans connexion ni abonnement.

L’outil le plus simple pour ça s’appelle Ollama. Il est gratuit, disponible sur Windows, macOS et Linux, et il se pilote avec quelques commandes.

À retenir Une IA locale est privée (rien ne quitte votre PC), gratuite et utilisable hors ligne. En contrepartie, elle est généralement moins performante que les grands modèles en ligne, et sa vitesse dépend de votre matériel.

Pourquoi utiliser une IA en local ?

  • Confidentialité : vous pouvez lui soumettre des documents sensibles (contrats, données clients, code propriétaire), puisque rien n’est envoyé sur Internet.
  • Coût : aucun abonnement ni paiement à l’usage.
  • Hors ligne : elle fonctionne dans le train, en avion, ou sur un réseau restreint.
  • Automatisation : Ollama expose une API locale, que vous pouvez appeler depuis vos scripts ou depuis n8n.

Quel matériel faut-il ?

C’est la vraie question. Un modèle d’IA se mesure en paramètres : 1 milliard (« 1B »), 8 milliards (« 8B »), 70 milliards (« 70B »)… Plus il est gros, plus il est capable, mais plus il demande de mémoire.

Le dépôt officiel d’Ollama donne cet ordre de grandeur pour la mémoire vive (RAM) :

Taille du modèle RAM recommandée
~7B au moins 8 Go
~13B au moins 16 Go
~33B au moins 32 Go

Les petits modèles, de 1 à 4 milliards de paramètres, tournent sur la plupart des ordinateurs récents. Une carte graphique compatible, ou une puce Apple Silicon, accélère fortement les réponses. Sans elle, le processeur fait le travail, plus lentement.

Étape 1 : installer Ollama

  • Windows et macOS : téléchargez l’installeur sur ollama.com et lancez-le.
  • Linux : la commande d’installation officielle est indiquée sur le site. Comme pour tout script téléchargé, lisez-la avant de l’exécuter.

Vérifiez ensuite l’installation dans un terminal :

ollama --version

Étape 2 : télécharger et lancer un modèle

La bibliothèque de modèles liste les modèles disponibles : ceux de Meta (Llama), Google (Gemma), Mistral, Alibaba (Qwen)… Chaque fiche indique les tailles proposées.

Pour lancer un modèle, utilisez son nom tel qu’il apparaît dans la bibliothèque :

ollama run llama3.2

Le nom llama3.2 est un exemple : les modèles disponibles évoluent régulièrement, consultez la bibliothèque pour choisir.

Au premier lancement, Ollama télécharge le modèle, ce qui peut représenter plusieurs gigaoctets. Une invite s’affiche ensuite : vous discutez avec l’IA directement dans le terminal. Tapez /bye pour quitter.

Les commandes essentielles

ollama list            # modèles installés
ollama pull <modèle>   # télécharger un modèle sans le lancer
ollama run <modèle>    # discuter avec un modèle
ollama rm <modèle>     # supprimer un modèle (libère l'espace disque)
ollama ps              # modèles actuellement chargés en mémoire

Étape 3 (bonus) : utiliser l’API locale

Ollama fait tourner un petit serveur local, par défaut à l’adresse http://localhost:11434. N’importe quel programme de votre ordinateur peut l’interroger :

curl http://localhost:11434/api/generate -d '{
  "model": "llama3.2",
  "prompt": "Résume en une phrase ce qu'est un webhook.",
  "stream": false
}'

C’est ce qui permet de brancher une IA locale dans une automatisation : n8n propose des nœuds compatibles avec Ollama. Vous pouvez aussi installer une interface graphique de type « chat », comme Open WebUI, si vous préférez éviter le terminal.

Par défaut, ce serveur n’écoute que sur votre propre machine. Si vous le rendez accessible sur le réseau, protégez-le : il n’a pas de mot de passe.

Les limites à connaître

  • Moins de capacités que les plus grands modèles en ligne, surtout pour le raisonnement complexe et les longues tâches.
  • Pas de connaissances récentes : un modèle ne sait que ce qu’il a appris jusqu’à sa date d’entraînement, et il ne consulte pas Internet.
  • Des erreurs possibles, comme toute IA générative : les modèles locaux peuvent aussi inventer des informations. Vérifiez les faits importants.
  • De l’espace disque : chaque modèle occupe de un à plusieurs dizaines de gigaoctets.

En résumé

Avec Ollama, trois commandes suffisent pour avoir une IA privée et gratuite sur votre PC : installer, ollama run, discuter. Commencez par un petit modèle pour évaluer la vitesse sur votre machine, puis montez en taille si votre matériel le permet.

Pour tirer le meilleur de n’importe quel modèle, local ou en ligne, appliquez notre méthode pour écrire un bon prompt.