Entrada #010v0.7.3Evaluación
18 MAY 2026Transferido a Fluxia
Evaluación ciega de calibración de confianza en respuestas probabilísticas de agentes de triaje
Implementación de escala de Brier multiclase para forzar abstención del agente cuando la incertidumbre acumulada supera 0.25.
Área: Evaluación·Transferido a: Fluxia SafeTriage Guard v1.0
1. Hipótesis inicial
Forzar abstención deliberada en vectores con baja densidad de vecindad reduce a cero las alucinaciones críticas en clasificación de gravedad.
2. Procedimiento reproducible
- Calibración de temperatura sobre 3.000 casos clínicos y técnicos etiquetados manualmente.
- Ajuste de umbrales mediante optimización Platt scaling.
- Verificación de casos de abstención segura remitidos a operador humano.
3. Medición y telemetría de nodo
Brier Score0.084
Frente a 0.229 del modelo no calibrado
Falsos positivos críticos0
En conjunto de test de 1.200 muestras
Tasa de abstención adecuada14.1%
Casos derivados a revisión humana
Figura 3.1 · Registro directo del canal de telemetría (Log de nodo)
[CALIBRATION] Temperature scaling fitted: T=1.42
[BENCHMARK] Total cases: 1,200 | Confident & Correct: 1,031 | Abstained: 169 | Confident & Incorrect: 0.4.1 Resultado empírico
Confirmado. La abstención explícita es viable técnicamente y garantiza que el sistema no emita conclusiones categóricas en regiones de escasa densidad de entrenamiento.
4.2 Límite del experimento
Requiere acceso a logits de salida (imposible con proveedores que solo ofrecen texto generado).
5. Qué no se puede concluir de esto
- No soluciona la falta de datos de soporte; únicamente evita la respuesta categórica falsa.
- El 14.1% de abstención debe ser absorbido por un flujo humano de resolución.
Contraste de hipótesis
Contacto técnico¿Dispones de datos para replicar o refutar este resultado?
Intercambiamos esquemas de test con equipos de investigación.