Programování Expert comet

Komplexní evaluace LLM pipeline

Pokročilý prompt pro návrh a automatizaci testovací sady v platformě Comet pro validaci LLM aplikací.

Prompt text

Délka: Dlouhý
Jsi expertní ML inženýr specializující se na observabilitu a evaluaci LLM pomocí platformy Comet. Tvým úkolem je navrhnout strukturovanou strategii evaluace pro [NÁZEV_PROJEKTU], která se zaměřuje na [CÍLOVÝ_USE_CASE].

Tvoje odpověď musí obsahovat:
1. Definici klíčových metrik (např. faithfulness, answer_relevance, context_precision) a zdůvodnění jejich výběru pro Comet LLM Evaluation.
2. Návrh Python skriptu využívajícího `comet_llm` SDK pro logování experimentů. Skript musí obsahovat inicializaci `comet_llm.init` a logování `comet_llm.log_prompt` s parametry pro vstup, výstup a metadata.
3. Specifikaci `evaluation_dataset` ve formátu JSONL, který bude obsahovat variabilní příklady (few-shot) pro robustní testování.
4. Postup pro vytvoření "Custom Evaluation Metrics" v Comet, pokud standardní metriky RAGAS nestačí.
5. Strategii pro monitorování driftu v produkci a nastavení alertů pro metriky, které klesnou pod [HRANIČNÍ_HODNOTA].

Piš kód v Pythonu, dodržuj best practices pro čistý kód a integrovatelnost do CI/CD pipeline. Zaměř se na to, aby výsledná evaluace byla reprodukovatelná a přehledně vizualizovaná v Comet UI.
Interaktivní tvůrce

Příklad použití

Vstup:

NÁZEV_PROJEKTU: AI-Legal-Assistant
CÍLOVÝ_USE_CASE: Analýza smluvních doložek a extrakce rizik
HRANIČNÍ_HODNOTA: 0.75 pro metriku Answer Relevance

Výstup:

Zde je návrh implementace pro váš projekt AI-Legal-Assistant:

1. Definice metrik: Pro analýzu smluv doporučuji prioritizovat 'Faithfulness' (zda odpověď vychází z dokumentu) a 'Answer Relevance'. V Comet UI vytvoříme custom dashboard sledující tyto dvě metriky v čase.

2. Python implementace (ukázka):
```python
import comet_llm

comet_llm.init(project="ai-legal-assistant", api_key="YOUR_KEY")

# Logování evaluace
comet_llm.log_prompt(
prompt="Analyzuj rizika v doložce: {clause}",
output=model_response,
metadata={"model": "gpt-4", "temperature": 0.2},
evaluation_metrics={"faithfulness": 0.85, "relevance": 0.9}
)
```
3. Dataset: Struktura JSONL bude obsahovat pole 'question', 'ground_truth' a 'context'.

4. Monitorování: Nastavíme v Comet 'Production Monitoring' pro detekci anomálií v distribuci odpovědí. Pokud relevance klesne pod 0.75, Comet automaticky spustí notifikaci do Slacku.

Kde použít tento prompt?

Najděte vhodné AI nástroje pro použití tohoto promptu a maximalizujte jeho efektivitu.

Objevte další AI prompty

Prozkoumejte naši sbírku Programování promptů a najděte ty, které vám pomohou dosáhnout lepších výsledků.