Entrada #012v0.8.6Memoria
14 JUL 2026Límite alcanzado
Latencia inducida por vectorización híbrida (BM25 + Dense) frente a sparse embeddings puros
Medición comparativa de precisión de recuperación y latencia P99 en un corpus documental interno de 180.000 párrafos técnicos.
Área: Memoria·Sin transferencia a producto
1. Hipótesis inicial
La combinación lineal ponderada con re-ranking bi-encoder añade menos de 65 ms a la consulta global manteniendo un MRR@5 superior a 0.88.
2. Procedimiento reproducible
- Indexación concurrente en Qdrant (dense) y Lucene nativo (sparse BM25).
- Inyección de 2.500 consultas formuladas con terminología ambigua.
- Medición de latencia de pipeline completa: embedding + dual retrieval + reciprocal rank fusion + cross-encoder re-ranking.
3. Medición y telemetría de nodo
MRR@5 obtenido0.894
Supera el umbral de 0.88
Latencia agregada P99148 ms+83 ms sobre límite fijado
Cuello de botella en cross-encoder
P95 latencia sin cross-encoder39 ms
MRR cae a 0.79
Figura 3.1 · Registro directo del canal de telemetría (Log de nodo)
[STAGE_1: BM25] 12ms (50 candidates)
[STAGE_2: Dense] 24ms (50 candidates)
[STAGE_3: RRF Fusion] 3ms
[STAGE_4: Cross-Encoder] 109ms (20 pairs re-scored) -> OVER BUDGET4.1 Resultado empírico
Límite alcanzado: el cross-encoder aporta el 74% de la precisión requerida pero incumple de forma sistemática el presupuesto de latencia de 65 ms en hardware estándar.
4.2 Límite del experimento
Sin acelerador GPU dedicado para re-ranking en el perímetro.
5. Qué no se puede concluir de esto
- No se descarta el enfoque si se dispone de tensor RT con cuantización fp8.
- No se invalida la fusión RRF, que mostró excelente correlación con bajo consumo de CPU.
Contraste de hipótesis
Contacto técnico¿Dispones de datos para replicar o refutar este resultado?
Intercambiamos esquemas de test con equipos de investigación.