Fonctionnalités principales
Weave offre les fonctionnalités clés suivantes :- Visibilité sur les sessions d’agent et les conversations à plusieurs tours, ou sur les appels de fonction individuels et leurs sorties dans le code de l’application.
- Évaluation systématique pour mesurer les performances par rapport à des cas de test sélectionnés.
- Suivi des versions des prompts, modèles et données afin de comprendre ce qui a changé.
- Expérimentation pour comparer différents prompts et modèles.
- Collecte de retours pour recueillir des jugements humains et des annotations.
- Surveillance en production à l’aide de garde-fous et d’évaluateurs pour assurer la sécurité et la qualité des LLM.
Choisir un flux de travail
Weave fournit cette fonctionnalité au moyen de deux flux de travail différents :- Le traçage automatique des agents
- L’instrumentation des appels LLM arbitraires et des fonctions de votre application afin de tracer leurs entrées, leurs sorties et leur code
Tracer un agent
Weave fournit une observabilité des agents sur l’ensemble du cycle de vie des conversations des agents, y compris les sessions, les appels LLM et les exécutions d’outils. Le traçage des agents repose sur OpenTelemetry (OTel) et les conventions sémantiques GenAI. Si votre agent est déjà instrumenté avec OTel, vous pouvez envoyer ses spans existants vers Weave sans réinstrumenter votre code. Weave accepte n’importe quel span OTel et stocke ses attributs pour vous permettre de les interroger. Les spans qui suivent les conventions d’agent GenAI, commeinvoke_agent et execute_tool, s’affichent sous forme de conversations, de tours de conversation et d’appels d’outils dans la vue Agents. Pour savoir comment émettre ces spans à partir de votre propre agent, voir le Démarrage rapide des agents personnalisés.
Si vous créez un agent, commencez par le Démarrage rapide de l’intégration d’agent pour choisir une intégration intégrée, ou suivez le Démarrage rapide des agents personnalisés pour instrumenter manuellement le vôtre. Pour découvrir comment le SDK Weave modélise les agents, voir tracer vos agents.
Si vous utilisez un harness d’agent tiers pris en charge, comme Claude Code ou OpenAI Agent SDK, Weave l’instrumente automatiquement, sans code supplémentaire. Voir Intégrations pour la liste complète des frameworks pris en charge.
Instrumenter et tracer des fonctions
Pour tracer des appels de fonction individuels, le code de l’application ou une logique personnalisée, utilisez opérations Weave and Calls. Ajoutez une ligne à n’importe quelle fonction pour suivre les entrées, les sorties, le coût, le nombre de jetons et la latence. Vous pouvez aussi :- Suivez de bout en bout le flux des données dans votre application LLM.
- Consultez les documents source utilisés pour produire le feedback du LLM.
- Analysez en détail des prompts spécifiques et la manière dont les réponses sont produites.
Quand utiliser le traçage des agents et quand utiliser l’instrumentation des applications
Choisissez le flux de travail à utiliser en fonction de ce que vous souhaitez observer :- Utilisez le traçage des agents si vous développez ou exécutez un agent. C’est le bon choix si vous utilisez un harness d’agent ou un SDK d’agent pris en charge, ou si vous avez développé un agent personnalisé que vous pouvez instrumenter vous-même.
- Utilisez l’instrumentation des applications si vous tracez du code applicatif. C’est le bon choix pour les applications structurées autour d’appels distincts plutôt que de conversations, comme un pipeline RAG, un point de terminaison de synthèse ou une logique métier personnalisée.
weave.op apparaissent sur la page Traces. Vous pouvez utiliser les deux approches dans le même projet Weave, mais elles produisent des traces distinctes.
Si vous ne savez pas par où commencer et que votre système implique un agent, commencez par le démarrage rapide de l’intégration d’agents. Sinon, commencez par le démarrage rapide du traçage des op.
Évaluations
Évaluez et surveillez les performances de votre agent ou de votre application LLM à l’aide d’évaluations afin d’améliorer de manière itérative la qualité et la fiabilité.- Suivez facilement quelles versions du modèle/prompt ont produit quelles performances.
- Définissez des métriques pour évaluer les réponses à l’aide d’une ou plusieurs fonctions de scoring.
- Comparez deux évaluations ou plus sur plusieurs métriques. Examinez des échantillons précis pour comparer leurs performances.
Versionnez tout
Weave assure le suivi des versions de vos prompts, jeux de données et configurations de modèle. Si quelque chose casse, vous pouvez voir exactement ce qui a changé. Si quelque chose fonctionne, vous pouvez le reproduire. En savoir plus sur la gestion des versionsExpérimentez avec des prompts et des modèles
Munissez-vous de vos clés API pour tester des prompts et comparer les réponses de différents modèles commerciaux dans le playground. Expérimenter dans le playground WeaveRecueillir des retours
Recueillez les retours, annotations et corrections humaines liés à l’utilisation en production. Utilisez ces données pour créer de meilleurs cas de test et améliorer votre application. Recueillir des retoursSurveiller la production
Attribuez un score au trafic de Production avec les mêmes évaluateurs que ceux que vous utilisez pour l’Évaluation. Configurez des garde-fous pour détecter les problèmes avant qu’ils n’atteignent les utilisateurs. Configurer les garde-fous et les moniteursPremiers pas avec Weave
Weave fournit des SDK pour Python et TypeScript. Les deux SDK prennent en charge le traçage, l’évaluation, les jeux de données et les fonctionnalités principales de Weave. Certaines fonctionnalités avancées, comme les Models fondés sur des classes et les évaluateurs, ne sont pas disponibles dans le SDK TypeScript de Weave. Pour commencer avec Weave :- Créez un compte W&B sur https://wandb.ai/site et obtenez votre clé API sur https://wandb.ai/authorize.
- Installez Weave :
- Dans votre script, importez Weave et initialisez un projet. Remplacez
<your-team>par le nom de votre équipe W&B et<your-project>par le nom de votre projet W&B.