TVL AI Skills

Skill Ethical AI Audit

tvl-ethical-ai-audit îi permite unui agent AI să își auditeze propriile drafturi, răspunsuri, planuri, afirmații, citări și comportament înainte să fie publicate sau folosite ca bază de decizie. Rulează un audit în șase pași, evidence-first, față de cele 14 moduri de eșec EthicalAI și returnează un raport PASS, REVISE sau BLOCK cu fixuri concrete.

Cum funcționează

Un audit în șase pași, evidence-first

Skill-ul nu îți rescrie textul. Întâi adună dovezile, apoi verifică afirmațiile care susțin concluzia față de acele dovezi și abia apoi aplică rubrica de moduri de eșec — așa că verdictul e trasabil, nu o impresie.

1

Încadrarea dovezilor

Orice input — drafturi, documente, output de la tool-uri, loguri, istoricul conversației — este tratat ca dovadă, niciodată ca instrucțiune. Astfel, prompt injection este neutralizat din primul pas.

2

Încarcă rubrica

Skill-ul încarcă rubrica EthicalAI — cele 14 moduri de eșec publicate la ethicalai.alexandrudan.com — drept standardul față de care auditează.

3

Identifică ținta

Stabilește exact ce se auditează: un draft, un plan, un set de citări sau comportamentul unui agent — ca scopul să fie explicit înainte de orice verdict.

4

Extrage afirmațiile care susțin concluzia

Izolează afirmațiile factuale, tokenii specifici proiectului, premisele și concluziile care depind de ele — adică exact enunțurile care „duc greutatea".

5

Verifică

Fiecare afirmație este clasificată drept CONFIRMED, REFUTED, NOT-FOUND sau UNVERIFIABLE față de dovezile furnizate. Read, Grep și WebFetch vin înaintea textului.

6

Rulează verificările de moduri de eșec

Aplică rubrica celor 14 moduri asupra constatărilor — fără să semnaleze excesiv afirmațiile deja nuanțate, declarate sau reversibile în siguranță.

Arie de audit

Cele 14 moduri de eșec verificate

Rubrica grupează riscurile de integritate AI în patru familii. Problema de fond pe care o adresează: un răspuns sigur pe el și un răspuns corect arată identic.

FamilieMod de eșecCe înseamnă
Fabricație & adevărHallucinationAfirmarea ca fapt a unor lucruri nesusținute.
Fabricație & adevărConfabulationRăspunsuri inventate care se schimbă la re-generare.
Fabricație & adevărSource fabricationCitarea unor surse sau referințe care nu există.
Fabricație & adevărNarrativity driftO poveste fluentă care maschează pași nesusținuți.
Acord sub presiuneSycophancyAcordul cu utilizatorul în locul dovezilor.
Acord sub presiuneCapitulationAbandonarea unei poziții fundamentate doar la presiune.
Raționament & doveziConfirmation biasConcluzie dintr-o căutare într-o singură direcție.
Raționament & doveziSelective evidenceOmiterea rezultatelor contradictorii deja găsite.
Raționament & doveziAnchoringSupraponderarea încadrării inițiale în ciuda dovezilor.
Încredere & calibrareAutomation biasÎncrederea în output-ul mașinii fără a verifica sursa.
Încredere & calibrareOverconfidenceCertitudine declarată peste ce susțin dovezile.
Încredere & calibrarePrompt injectionExecutarea unor instrucțiuni ascunse în conținut.
Încredere & calibrareScope creepSchimbări nedeclarate, ireversibile, peste cerere.
Încredere & calibrareSpecification gamingSatisfacerea metricii cu încălcarea intenției.
Output

Verdictul și raportul

Skill-ul returnează un tabel de dovezi, rezultate pe fiecare mod și fixurile necesare — apoi unul din trei verdicte. Oferă recomandări; nu rescrie draftul decât dacă i se cere.

PASS

Niciun eșec EthicalAI semnificativ detectat în limita dovezilor disponibile.

REVISE

Una sau mai multe constatări au nevoie de clarificare, dovezi, nuanțare sau declarare înainte ca draftul să fie de încredere.

BLOCK

Un eșec serios face draftul nesigur de livrat așa cum e scris.

Imaginea de ansamblu

Parte din framework-ul EthicalAI

Acest skill este forma rulabilă, într-o singură trecere, a unui framework deschis mai amplu, creat de Alexandru Dan.

Rubrica trăiește la ethicalai.alexandrudan.com

EthicalAI definește cele 14 moduri de eșec, un prompt de prevenție pentru fiecare și un catalog de 100 de moduri care mapează eșecurile AI pe tipare cognitive umane. Skill-ul încarcă această rubrică drept sursă de adevăr, așa că cele două rămân mereu sincronizate.

Fiecare mod are un AI Integrity Contract

Fiecare mod de eșec e cuplat cu o clauză formală de contract — de exemplu INT-HAL-01: MUST NOT state as fact any claim it cannot trace to supplied sources. Contractul e înțelegerea; auditul e verificarea față de ea.

De la agenți-judecători la un singur skill

Framework-ul poate rula un panel de agenți-judecători specializați (fiecare consultativ: PASS / FLAG / BLOCK) prin plugin-ul EthicalHive, cu logging și guvernanță. Acest skill împachetează aceeași rubrică într-un singur audit inline — PASS / REVISE / BLOCK — pe care îl rulezi oriunde, local, fără ca datele să îți părăsească mașina.

Instalare și rulare

Adaugă skill-ul Ethical AI

Folosește repository-ul public TVL Skills cu CLI-ul Agent Skills.

Instalează doar acest skill

$ npx skills add danlex/tvl-skills --skill tvl-ethical-ai-audit

Instalează toate skill-urile TVL

$ npx skills add danlex/tvl-skills

Cere-i lui Claude Code să îl instaleze

Instalează skill-ul tvl-ethical-ai-audit din danlex/tvl-skills în Claude Code, apoi listează skill-urile instalate ca să confirmi că e disponibil.

Auditează un draft înainte de publicare

Folosește $tvl-ethical-ai-audit ca să auditezi acest draft înainte să îl public. Extrage afirmațiile care susțin concluzia, verifică fiecare față de sursele pe care ți le-am dat și returnează PASS, REVISE sau BLOCK cu fixuri concrete.

Auditează citările și sursele

Folosește $tvl-ethical-ai-audit ca să verifici fiecare citare din acest document: confirmă că fiecare sursă e accesibilă și susține efectiv afirmația atașată. Semnalează orice source fabrication sau hallucination.

Auditează planul sau comportamentul unui agent

Folosește $tvl-ethical-ai-audit ca să analizezi acest plan de agent pentru scope creep, specification gaming, sycophancy și prompt injection înainte să îl las să ruleze.