Saltar al contenido principal
Contacto técnico
Entrada #012v0.8.6Memoria
14 JUL 2026Límite alcanzado

Latencia inducida por vectorización híbrida (BM25 + Dense) frente a sparse embeddings puros

Medición comparativa de precisión de recuperación y latencia P99 en un corpus documental interno de 180.000 párrafos técnicos.

Área: Memoria·Sin transferencia a producto

1. Hipótesis inicial

La combinación lineal ponderada con re-ranking bi-encoder añade menos de 65 ms a la consulta global manteniendo un MRR@5 superior a 0.88.

2. Procedimiento reproducible

  1. Indexación concurrente en Qdrant (dense) y Lucene nativo (sparse BM25).
  2. Inyección de 2.500 consultas formuladas con terminología ambigua.
  3. Medición de latencia de pipeline completa: embedding + dual retrieval + reciprocal rank fusion + cross-encoder re-ranking.

3. Medición y telemetría de nodo

MRR@5 obtenido0.894

Supera el umbral de 0.88

Latencia agregada P99148 ms+83 ms sobre límite fijado

Cuello de botella en cross-encoder

P95 latencia sin cross-encoder39 ms

MRR cae a 0.79

Figura 3.1 · Registro directo del canal de telemetría (Log de nodo)
[STAGE_1: BM25] 12ms (50 candidates)
[STAGE_2: Dense] 24ms (50 candidates)
[STAGE_3: RRF Fusion] 3ms
[STAGE_4: Cross-Encoder] 109ms (20 pairs re-scored) -> OVER BUDGET

4.1 Resultado empírico

Límite alcanzado: el cross-encoder aporta el 74% de la precisión requerida pero incumple de forma sistemática el presupuesto de latencia de 65 ms en hardware estándar.

4.2 Límite del experimento

Sin acelerador GPU dedicado para re-ranking en el perímetro.

5. Qué no se puede concluir de esto

  • No se descarta el enfoque si se dispone de tensor RT con cuantización fp8.
  • No se invalida la fusión RRF, que mostró excelente correlación con bajo consumo de CPU.
Contraste de hipótesis

¿Dispones de datos para replicar o refutar este resultado?

Intercambiamos esquemas de test con equipos de investigación.

Contacto técnico