Files
admin f7ad9ba51f Establish prompt engineering baseline with Gold Standard tests
- introduce Gold Standard evaluation corpus
- document decision taxonomy
- define prompt-engineering methodology
- add regression workflow
- establish Prompt Version 2 baseline
- validate decision_simple, decision_deferred and decision_none
2026-07-30 12:13:10 +02:00

12 lines
394 B
Markdown

# facts_vs_positions
Tests separation of objective facts from personal opinions.
The transcript deliberately mixes numeric facts, named non-respondents, and subjective positions about rollout health.
Typical LLM mistakes:
- Treating Marta's opinion as an objective fact.
- Treating Leo's optimism as a fact.
- Extracting a rollout decision even though the group explicitly does not decide.