Datos y cobertura

Por consulta o por jurisdicción: qué denominador responde cada pregunta

La misma cohorte puede producir tasas distintas si se divide por sesiones, jurisdicciones o fuentes. La pregunta debe definir el denominador antes del cálculo.

Por Marco Ferreiro ·

Fichas distribuidas por sesiones, territorios y fuentes en recipientes separados

Decir que “el 20 % encontró multas” parece preciso hasta que preguntamos: ¿20 % de qué? Puede ser de consultas iniciadas, consultas completas, jurisdicciones alcanzadas, fuentes ejecutadas o vehículos únicos. Cada denominador responde una pregunta distinta.

Elegirlo después de ver el resultado permite contar una historia conveniente. Elegirlo antes y publicarlo permite evaluar el dato.

Tres unidades que usamos por separado

La primera es la sesión de consulta completa: una búsqueda web válida que terminó bajo la definición metodológica publicada. Sirve para preguntar cuántas consultas encontraron al menos una infracción.

La segunda es el par consulta-jurisdicción. Una sesión puede requerir CABA, Provincia de Buenos Aires y un municipio. Sirve para analizar cobertura territorial, no personas.

La tercera es la ejecución de fuente. Una jurisdicción puede necesitar más de un portal y una fuente puede reintentarse. Sirve para medir operación técnica.

No son filas intercambiables. Una sesión puede producir tres pares jurisdiccionales y cinco ejecuciones.

Ejemplo sintético y reproducible

Imaginemos 200 consultas completas. De ellas, 50 encuentran al menos una infracción. La tasa por consulta es:

50 / 200 = 25 %

Esas sesiones generan 320 pares consulta-jurisdicción. En 64 pares aparece al menos un resultado:

64 / 320 = 20 %

Finalmente se realizan 400 ejecuciones de fuente, de las cuales 360 completan. La tasa de finalización técnica es:

360 / 400 = 90 %

Los tres porcentajes son compatibles. Ninguno corrige a los otros porque miden fenómenos diferentes.

Pregunta uno: experiencia de una consulta

Si queremos saber “entre consultas web completas, cuántas encontraron algo”, el denominador son sesiones completas válidas. Cada sesión cuenta una vez.

El numerador no debe sumar actas. Una consulta con diez infracciones y otra con una aportan una sesión positiva cada una.

También hay que definir cuándo una sesión está completa. Si una fuente crítica falló y el producto mostró un resultado parcial, incluirla puede reducir artificialmente la tasa. La exclusión debe basarse en reglas anteriores al análisis, no en que el resultado sea cero.

Pregunta dos: cobertura por jurisdicción

Si buscamos comparar cuántas jurisdicciones devolvieron datos, la unidad es cada par efectivamente consultado. Una misma sesión puede aportar varios pares.

El denominador debe excluir jurisdicciones no aplicables, pero no aquellas consultadas que respondieron cero. “No aplicable”, “sin resultados” y “falló” son estados distintos.

Una tasa alta en una jurisdicción no significa que allí existan más infracciones. Puede reflejar el perfil de quienes consultan, los recorridos, la cobertura y el momento de carga.

Pregunta tres: salud de las fuentes

Disponibilidad técnica usa ejecuciones o trabajos programados como unidad. El numerador puede ser finalizaciones válidas, respuestas dentro de tiempo o contratos completos.

No debería mezclarse con hallazgos. Una fuente puede funcionar al 100 % y devolver cero resultados válidos. Otra puede tener muchos hallazgos entre las pocas veces que logra responder.

Para reintentos, definí si el denominador cuenta intentos o consultas lógicas. Ambas métricas sirven: intentos muestran carga y consultas lógicas muestran experiencia final.

La deduplicación cambia el numerador

Una misma acta puede aparecer en dos fuentes. Si la métrica es “actas observadas”, necesitás una regla de identidad antes de sumar. Si la métrica es “pares con al menos un resultado”, la duplicación de actas dentro del par no cambia el numerador.

No unas registros sólo por monto o fecha. Usá identificadores oficiales y campos compatibles, conservando procedencia. Cuando la identidad es incierta, publicá el rango o mantené registros separados.

La regla de deduplicación forma parte de la metodología tanto como el denominador.

Un embudo que evita bases móviles

Construimos la base en etapas:

  1. período cerrado;
  2. sesiones web elegibles;
  3. exclusión de bots, tests, replay y errores definidos;
  4. confirmación de finalización;
  5. expansión a jurisdicciones aplicables;
  6. expansión a ejecuciones de fuente;
  7. cálculo independiente de cada métrica.

Cada etapa registra cuántas unidades entran y salen. Así el lector puede ver por qué el total de fuentes es mayor que el total de sesiones.

Celdas pequeñas y privacidad

En métricas operativas propias exigimos al menos 100 casos por celda. El umbral se aplica al denominador concreto: no alcanza con tener 10.000 consultas totales si una jurisdicción sólo tiene 27 pares.

La supresión reduce inestabilidad y riesgos de inferencia, pero no convierte la muestra en representativa. Tampoco habilita publicar patentes, actas, ubicaciones o IDs.

Agrupá períodos o categorías antes de reducir el umbral. Si aun así no llega, omití el porcentaje y explicá que no hay base suficiente.

Metadatos mínimos junto al porcentaje

Los principios estadísticos de Naciones Unidas enfatizan transparencia sobre fuentes, métodos y procedimientos. Para cada indicador publicamos:

Datos Argentina también destaca la calidad de datos y metadatos. Un porcentaje sin esos elementos no es reproducible.

Comparar períodos sin mover la definición

Si en julio se cuentan sesiones completas y en agosto sesiones iniciadas, la diferencia mezcla comportamiento y método. Versioná la definición y recalculá ambos períodos con la misma regla cuando sea posible.

Los cambios de cobertura también necesitan una ruptura visible. Agregar una jurisdicción puede aumentar pares y hallazgos aunque la conducta de los usuarios no cambie.

No presentes una serie continua cuando el denominador fue redefinido. Marcá el corte y explicá el impacto.

Qué conclusión permite cada tasa

La tasa por consulta describe la experiencia de la muestra de sesiones elegibles. La tasa por jurisdicción describe pares consultados. La tasa por fuente describe operación técnica.

Ninguna representa por sí sola “qué porcentaje de autos argentinos tiene multas”. Quienes usan multas.ar no son una muestra aleatoria del parque automotor.

La regla final es simple: primero la pregunta, luego la unidad, después el denominador y recién entonces el porcentaje. Cambiar ese orden cambia la historia, aunque los datos base sean idénticos.

Metodología

Alcance
Ejemplo sintético reproducible que calcula métricas por sesión, par consulta-jurisdicción y ejecución de fuente.
Unidad de análisis
Sesión completa, jurisdicción efectivamente consultada o ejecución técnica, según la pregunta.
Cobertura
Principios estadísticos y de metadatos consultados el 14 de agosto de 2026.

Limitaciones

Fuentes

Preguntas frecuentes

¿Cuál es el denominador correcto?

Depende de la pregunta. Una tasa por sesión, una tasa por jurisdicción consultada y una tasa técnica por fuente describen unidades diferentes.

¿Se pueden sumar resultados de jurisdicciones?

Sólo con una regla explícita de deduplicación y cobertura. Una misma sesión o acta puede aparecer en más de una capa y contarla dos veces cambia la métrica.

¿Por qué suprimir celdas con menos de 100 casos?

Para evitar porcentajes inestables y reducir riesgos de inferencia. El umbral debe aplicarse al denominador de cada celda, no al total general.

Notas relacionadas