Pular para o conteúdo
🆕 New skill: Pstack Skill! Lauren Tan's rigorous engineering orchestrator — 23 playbooks, 21 procedures, and 21 principles in a single skill for any agent.View skill →
🧠

TypeSafe Jev — Avaliações Calibradas para Agent Skills

Avaliações de probabilidade calibradas para critérios subjetivos em Agent Skills

TypeSafe Jev é um motor de julgamento que fornece avaliações de probabilidade calibradas para critérios subjetivos. Em vez de depender apenas de heurísticas determinísticas, Jev permite que skills façam julgamentos nuançados sobre qualidade, severidade e classificação.

Score (0.0 — 1.0)

Probabilidade calibrada para critérios onde gradações importam: severidade de padrão, qualidade de documentação, elegância de API, confiança na reescrita.

Noul (Classificação)

Classificação categórica para decisões binárias ou de poucas classes: pass/fail, presente/ausente, structural/cosmetic, suspected/not_suspected.

Sem Jev Com Jev
Heurísticas binárias (regex, pattern matching) Avaliações de probabilidade calibradas
“Padrão presente” ou “padrão ausente” “Padrão presente com severidade 0.73”
Classificação fixa Classificação com nível de confiança
Falsos positivos frequentes em edge cases Julgamentos nuançados em edge cases

Quatro skills do catálogo suportam integração opcional com TypeSafe Jev:

Humanizar

8 Score + 12 Noul — Severidade de padrões de IA, adequação de voz, confiança na reescrita, classificação de mudanças (structural/cosmetic/hybrid).

Ver skill →

Human-AI

8 Score + 12 Noul — Mesma estrutura da Humanizar, calibrada para padrões de escrita em inglês e 7 presets de voz diferentes.

Ver skill →

Slop Eval

8 Score + 16 Noul — Severidade de tells de design, qualidade por eixo (cor, tipografia, layout, motion), classificação de seções (CLEAN/SUSPICIOUS/INFLATED/CRITICAL).

Ver skill →

Agent Plugin Eval

7 Score + 19 Noul — Coerência de UX, clareza de documentação, elegância de API, classificação de gates, detecção de secrets, checklist de qualidade.

Ver skill →


Cada skill verifica a disponibilidade de Jev antes de usar:

from typesafe import jev_available
if jev_available():
from typesafe import Score, Noul
# Usar Jev para critérios subjetivos
else:
# Fallback para scoring heurístico

Cada skill inclui um arquivo jev_questions.json com as definições:

{
"version": "1.0",
"skill": "humanizar",
"questions": {
"score": [
{
"id": "pattern_severity",
"question": "How severe is this AI writing pattern in the context?",
"context_required": ["text_segment", "pattern_type", "surrounding_text"]
}
],
"noul": [
{
"id": "change_type",
"question": "What type of change is required to fix this pattern?",
"labels": ["structural", "cosmetic", "hybrid"]
}
]
}
}

Quando Jev não está disponível, as skills usam métodos heurísticos internos:

Skill Fallback sem Jev
Humanizar / Human-AI Scoring baseado em contagem e peso de padrões
Slop Eval Classificação por densidade de tells
Agent Plugin Eval Validação determinística + regex para secrets

O fallback é funcional mas menos nuançado em edge cases.


Cada skill com suporte Jev inclui:

Arquivo Descrição
scripts/jev_questions.json Definições de questões Score e Noul
references/jev-integration.md Protocolo de integração e exemplos de código
Seção no SKILL.md Documentação de quando e como usar Jev

Não. Jev é opcional. Todas as skills funcionam sem ele usando métodos heurísticos de fallback.

Consulte a documentação oficial do TypeSafe para instruções de instalação e configuração.

Posso adicionar suporte Jev à minha própria skill?

Seção intitulada “Posso adicionar suporte Jev à minha própria skill?”

Sim! Use o padrão de descoberta (jev_available()) e crie um jev_questions.json seguindo a estrutura documentada. Veja os arquivos jev-integration.md das skills existentes como referência.

Jev é útil para critérios subjetivos onde gradações importam. Skills com avaliações puramente determinísticas (validação de JSON, existência de arquivo, conformidade de schema) não se beneficiam de Jev.