SKILL.md
DaRa Dataset Expert Skill - v7.1
Zweck
Praezise, quellengebundene Analyse des DaRa-Datensatzes fuer manuelle Warehouse-Prozesse mit harter Trennung zwischen:
contracts/: Governance, MRP, PAC, Routing, Artefaktvertraegeknowledge/: fachliche Quelle der Wahrheitscripts/: kanonische Ausfuehrungslogiktemplates/: Berichtsvorlagen fuer Phase 5schemas/: formale Artefakt- und Protokollschemascompat/: Aliaslayer fuer alte Pfade
Oberste Regeln
- Nutze fuer Ausfuehrung ausschliesslich
scripts/, nicht Markdown-Code aus
knowledge/processes/*.md.
- Nutze
knowledge/als fachliche Quelle der Wahrheit, wenn Code und Text
konfligieren.
- Arbeite in
P0-P5undP2bimmer fuer genau einen vom Nutzer genanntensubject_id. - Vergleiche ueber mehrere Probanden erfolgen erst nach P5 oder in expliziten
Vergleichsartefakten.
- Lade in P5 genau ein Report-Template, ausser der Nutzer fordert explizit
kombinierte Ausgaben.
- Gib keine framebasierten Vollartefakte an das LLM weiter. Nutze Protokolle,
Pfade, Hashes und Summaries.
MRP - Mandatory Read Protocol
Lies in dieser Reihenfolge:
contracts/reading_protocol.mdcontracts/routing_matrix.mdcontracts/artifact_contracts.mdcontracts/response_protocol.md
Danach:
- fuer Fachfragen: passende Datei aus
knowledge/ - fuer Ausfuehrung: passendes Skript aus
scripts/ - fuer Berichte:
knowledge/processes/phase5_report.mdplus genau ein Template
Eine Datei gilt nur als vollstaendig gelesen, wenn sie bis zum Dateiende eingelesen wurde und vorhandene VERIFICATION_TOKENs extrahiert wurden.
Phasenlogik
P0: Annotation Bundle und Protokollbildung aus den 12 Roh-CSV-Dateien
mit normalized.duckdb und frame_records.parquet als kanonischer Basis
P1: Szenarioerkennung, erzeugtp1scenariotraceundp1phaseprotocolP2: REFA-/DaRa-Zeitanalyse, erzeugtp2refaanalysisund
p2phaseprotocol
P2b: REFA-Ablaufanalyse (v0.3.0), erzeugt
p2brefaablaufanalyse und p2bphaseprotocol
P3: MTM bleibtcontract-onlyund wissensbasiertP4: Process-Validierung, erzeugt Validierungsartefakt undp4phaseprotocolP5: Berichtserstellung, nutzt Protokolle zuerst und Templates genau einmal
Kanonische Pfade
Prozesse
knowledge/processes/phase1scenariorecognition.mdknowledge/processes/phase2refaanalysis.mdknowledge/processes/phase2brefaablaufanalyse.mdknowledge/processes/phase3mtmanalysis.mdknowledge/processes/phase4bpmnvalidation.mdknowledge/processes/phase5_report.mdknowledge/processes/referencebpmnflows.md
Kernwissen
knowledge/core/reference_labels.mdknowledge/core/referenceactivationrules.mdknowledge/core/referencevalidationrules.mdknowledge/core/reference_dataset.mdknowledge/core/reference_warehouse.mdknowledge/core/reference_articles.md
Methoden
knowledge/methods/reference_chunking.mdknowledge/methods/refaphase2manualorderpicking.md
Templates
templates/scenario_report.mdtemplates/phase2refaeinzelreport.mdtemplates/process_report.mdtemplates/sessioncomparisonreport.md
Skripte
scripts/common/annotation_bundle.pyscripts/phase1/scenario_recognition.pyscripts/phase2/refa_analysis.pyscripts/phase2b/refa_ablaufanalyse.pyscripts/phase4/process_validation.pyscripts/phase5/rendersubjectreport.pyscripts/session/rendermultisession_comparison.py
Schemas
schemas/p0framerecords.schema.jsonschemas/p0phaseprotocol.schema.jsonschemas/p1scenariotrace.schema.jsonschemas/p1phaseprotocol.schema.jsonschemas/p2phaseprotocol.schema.jsonschemas/p2refaanalysis.schema.jsonschemas/p2brefaablaufanalyse.schema.jsonschemas/p2bphaseprotocol.schema.jsonschemas/p3phaseprotocol.schema.jsonschemas/p4phaseprotocol.schema.jsonschemas/p5reportmeta.schema.json
Protokoll-First Regel
Fuer Folgephasen, Review und LLM-Handover gelten:
- benutze
phase_protocol-Artefakte zuerst - nutze Maschinenartefakte nur fuer deterministische Berechnung oder tiefe
Detaildarstellung
- uebergib niemals framebasierte Vollartefakte inline
- nutze in Folgephasen primaer
normalized.duckdboderframe_records.parquet,
nicht grosses P0-JSON
Template-Regel
P2 und P2b bleiben template-frei. Eine Anfrage nach probandenweisem Zeitaufnahme-/REFA-Bericht ist eine P5-Berichtsanfrage mit templates/phase2refaeinzelreport.md.
Sessionuebergreifende oder mehrprobandige Sammelreports laufen post-run ueber scripts/session/rendermultisession_comparison.py und greifen auf bereits vorliegende Session-Summaries/Protokolle zu.
Governance-Erweiterungen
PACbleibt vor jeder Fachantwort Pflicht.VERIFICATION_TOKENs werden aus geladenen Referenzen dokumentiert.comparison_corewird pro Phase budgetiert und spaeter fuer
Mehr-Probanden-Vergleiche verwendet.
metadata.duckdbist die kanonische lokale Metadatenbasis fuer
artifactregistry, comparisoncores und eval_runs.
- MongoDB ist optionale Zusatzintegration, aber kein Release-Gate und nicht
primaerer Frame- oder Rohdatenspeicher.
Antwortformat
- Deklariere geladene kanonische Dateien.
- Belege Aussagen mit Datei und Abschnitt.
- Stoppe, wenn Information oder Eingabe fehlt.
- Fuehre Berechnungen nur mit dokumentierten Inputs und Skripten aus.