Saltar al contenido principal
Contacto técnico
Entrada #010v0.7.3Evaluación
18 MAY 2026Transferido a Fluxia

Evaluación ciega de calibración de confianza en respuestas probabilísticas de agentes de triaje

Implementación de escala de Brier multiclase para forzar abstención del agente cuando la incertidumbre acumulada supera 0.25.

Área: Evaluación·Transferido a: Fluxia SafeTriage Guard v1.0

1. Hipótesis inicial

Forzar abstención deliberada en vectores con baja densidad de vecindad reduce a cero las alucinaciones críticas en clasificación de gravedad.

2. Procedimiento reproducible

  1. Calibración de temperatura sobre 3.000 casos clínicos y técnicos etiquetados manualmente.
  2. Ajuste de umbrales mediante optimización Platt scaling.
  3. Verificación de casos de abstención segura remitidos a operador humano.

3. Medición y telemetría de nodo

Brier Score0.084

Frente a 0.229 del modelo no calibrado

Falsos positivos críticos0

En conjunto de test de 1.200 muestras

Tasa de abstención adecuada14.1%

Casos derivados a revisión humana

Figura 3.1 · Registro directo del canal de telemetría (Log de nodo)
[CALIBRATION] Temperature scaling fitted: T=1.42
[BENCHMARK] Total cases: 1,200 | Confident & Correct: 1,031 | Abstained: 169 | Confident & Incorrect: 0.

4.1 Resultado empírico

Confirmado. La abstención explícita es viable técnicamente y garantiza que el sistema no emita conclusiones categóricas en regiones de escasa densidad de entrenamiento.

4.2 Límite del experimento

Requiere acceso a logits de salida (imposible con proveedores que solo ofrecen texto generado).

5. Qué no se puede concluir de esto

  • No soluciona la falta de datos de soporte; únicamente evita la respuesta categórica falsa.
  • El 14.1% de abstención debe ser absorbido por un flujo humano de resolución.
Contraste de hipótesis

¿Dispones de datos para replicar o refutar este resultado?

Intercambiamos esquemas de test con equipos de investigación.

Contacto técnico