Un outil open-source pour télécharger et exécuter des modèles de langage ouverts localement avec une seule commande, exposant une API compatible OpenAI.
Ollama récupère et exécute des modèles ouverts (Llama, Mistral, Gemma, Qwen, et bien d'autres) sur votre propre machine — `ollama run llama3` — et les met en service via une API HTTP locale qui imite le format OpenAI, afin que les outils existants et le code puissent y pointer simplement par un changement d'URL. Il gère les fichiers de modèles, la quantification et le déchargement vers GPU pour vous, et s'intègre aux éditeurs et aux cadres d'agents comme Claude Code, VS Code, et n8n.
Pourquoi c'est une découverte : c'est le chemin le plus simple vers l'inférence privée et hors ligne des LLMs, utilisé par des millions de développeurs. Le logiciel local est gratuit et open source ; il existe une option payante pour le cloud pour les grands modèles.
Idéal pour : les développeurs qui prototypent avec des LLMs sans factures d'API, et tout le monde qui a besoin de prompts fonctionnant sur son propre matériel.
N'a pas encore été présenté dans une vidéo.