Datos y cobertura

Cuánto aporta una fuente nueva a la cobertura: cómo medirlo

Sumar un portal no equivale a sumar cobertura. Proponemos medir qué resultados válidos agrega una fuente que no estaban en las fuentes anteriores.

Por Marco Ferreiro ·

Una nueva conexión suma un recorrido distinto a un mapa abstracto de fuentes

Integrar una fuente oficial nueva puede mejorar una consulta, pero el contador de portales no demuestra cuánto mejora. Dos organismos pueden exponer los mismos hechos, una fuente puede cubrir una población muy pequeña y otra puede estar disponible sólo durante parte del período. La pregunta medible es más exigente: ¿cuántos resultados válidos aparecen gracias a la fuente nueva y no aparecían en ninguna de las anteriores?

Esta nota describe el método que usaríamos para responderla. No presenta un porcentaje de producción: antes de publicar uno exigimos una cohorte comparable, al menos 100 consultas completas y un registro reproducible de exclusiones.

Cobertura no es cantidad de integraciones

Una integración confirma que existe un camino técnico hacia un organismo. Cobertura, en cambio, expresa qué parte de una necesidad de consulta puede responder el conjunto. Contar diez portales como diez unidades equivalentes supone que todos cubren casos distintos, funcionan igual y reciben la misma clase de actas. Esas condiciones rara vez están demostradas.

El SINAI explica que la carga y el juzgamiento dependen de cada municipio y que la centralización alcanza a jurisdicciones adheridas. Esa arquitectura ya impide interpretar una fuente nacional como inventario universal. Una fuente adicional puede repetir información nacional, agregar un municipio no adherido o ampliar un tipo de búsqueda. Cada caso tiene un valor distinto.

La métrica principal es el aporte marginal

Definimos dos conjuntos para cada consulta completa:

El numerador marginal cuenta consultas en las que la fuente nueva aporta al menos un hecho válido que no estaba en la base. El denominador reúne sólo consultas comparables, ejecutadas de verdad contra ambos conjuntos y terminadas bajo el mismo contrato operativo.

También conservamos un conteo de actas adicionales, pero no sustituye la métrica por consulta. Un único vehículo con muchas actas podría inflar el total sin mejorar la cobertura para la mayoría de la cohorte.

Solapamiento y aporte se informan juntos

Una fuente puede ser valiosa aun con alto solapamiento: podría mejorar disponibilidad o aportar campos verificables. Pero ese beneficio no debe presentarse como nuevos casos. Clasificamos cada ejecución en cuatro grupos:

Resultado de la comparación Interpretación
Sólo la base encuentra La fuente nueva no amplía ese caso
Ambas encuentran lo mismo Hay solapamiento
La nueva agrega hechos Existe aporte marginal
No son comparables Falta evidencia para medir

La suma se hace después de normalizar identidad del organismo, identificador del acta cuando existe, fecha, lugar y conducta. No deduplicamos sólo por texto o importe, porque dos hechos legítimos pueden parecerse.

Una cohorte equivalente evita atribuciones falsas

La comparación más sólida ejecuta ambos tratamientos sobre la misma consulta y dentro de una ventana corta. Si eso no es posible, usamos cohortes equivalentes por tipo de búsqueda, distribución geográfica, día y disponibilidad, y declaramos que la inferencia es menos fuerte.

Comparar “antes” y “después” sin esos controles puede atribuir a la integración un cambio que en realidad proviene de vacaciones, vencimientos, una campaña de fiscalización o una carga tardía del organismo. Tampoco mezclamos consultas por patente con consultas por persona: su universo observable puede ser distinto.

Completa significa que todas las etapas exigidas terminaron

Una consulta entra al denominador sólo si:

Un timeout no equivale a “cero actas”. Una respuesta bloqueada, un cambio de HTML o un portal no consultado tampoco. Esos estados forman una tasa de no comparabilidad separada. Ocultarlos haría parecer precisa una medición que no lo es.

El umbral de 100 protege contra lecturas frágiles

No publicamos una celda con menos de 100 consultas completas. El umbral no convierte automáticamente una muestra en representativa, pero reduce el riesgo de exhibir variaciones extremas y ayuda a evitar segmentos demasiado pequeños.

La supresión se aplica después de cada corte. Si el total supera 100 pero una provincia, semana o tipo de consulta no llega, ese desglose no se muestra. Tampoco se combinan celdas pequeñas de una forma que permita reconstruirlas por diferencia.

Qué debe acompañar a cualquier porcentaje

Un resultado publicable necesita, como mínimo:

  1. período exacto y zona horaria;
  2. numerador y denominador;
  3. definición de consulta completa;
  4. fuentes incluidas en la base;
  5. regla de identidad y deduplicación;
  6. solapamiento y no comparabilidad;
  7. exclusiones y cambios ocurridos durante el período;
  8. hash y versión de la consulta agregada.

La Data Quality Vocabulary del W3C distingue dimensiones y métricas concretas. Aplicamos esa idea: “cobertura” no queda como una etiqueta amplia, sino como una medición definida, calculada sobre una unidad y acompañada por procedencia.

Qué no permite concluir esta medición

El porcentaje describe consultas realizadas en multas.ar bajo el período y filtros publicados. No estima cuántos vehículos de Argentina tienen multas, no mide la calidad jurídica de cada acta y no prueba que una fuente sea exhaustiva dentro de su propia jurisdicción.

Tampoco convierte una consulta sin resultados en libre deuda. Sólo indica lo observado por las fuentes ejecutadas. La diferencia es esencial para que una mejora técnica no se transforme en una promesa que los datos no respaldan.

Una decisión de integración necesita más de un número

El aporte marginal ayuda a priorizar, pero se lee junto con disponibilidad, latencia, estabilidad del contrato, calidad de campos y costo operativo. Una fuente que agrega pocos casos puede ser decisiva para un corredor específico; otra con mayor volumen puede duplicar información sin mejorar la resolución.

La conclusión responsable no es “más portales es mejor”. Es que cada integración debe demostrar qué universo agrega, cuánto se superpone, con qué fiabilidad responde y qué parte de la medición quedó fuera. Sólo entonces cobertura deja de ser una lista comercial y se vuelve un dato auditable.

Metodología

Alcance
Diseño de una medición de aporte marginal para una nueva fuente oficial incorporada a una consulta de infracciones.
Unidad de análisis
Consulta completa comparable ejecutada contra el conjunto anterior y contra el conjunto que incorpora la fuente nueva.
Cobertura
Estándares de calidad de datos y superficies oficiales del SINAI revisados el 14 de agosto de 2026; no se publican resultados numéricos en esta nota.

Limitaciones

Fuentes

Preguntas frecuentes

¿Una fuente con muchas actas siempre aporta más cobertura?

No. Puede repetir casos ya encontrados por otras fuentes. El aporte marginal cuenta sólo los resultados adicionales y válidos dentro de una cohorte comparable.

¿Por qué se excluyen las consultas incompletas?

Porque un timeout o una fuente no ejecutada no permite decidir si había o no un resultado adicional. Incluirlo como cero subestimaría la cobertura y confundiría error con ausencia.

¿Se puede comparar una semana antes y otra después?

Sólo con cautela y controlando mezcla geográfica, tipo de consulta, disponibilidad y estacionalidad. La comparación pareada sobre la misma cohorte reduce ese sesgo.

Notas relacionadas