Datos y cobertura

Quienes consultan no representan a todos los autos: cómo medimos el sesgo

Las personas llegan a multas.ar por una necesidad concreta, no por muestreo aleatorio. Comparar agregados con el parque activo describe diferencias, pero no corrige automáticamente la selección.

Por Marco Ferreiro ·

Pequeña muestra de autos a escala frente a un estacionamiento mucho mayor

Quien consulta multas antes de comprar un usado, después de recibir una notificación o por administrar una flota no llegó al sitio al azar. Esa decisión puede estar relacionada con el resultado buscado.

Por eso las consultas de multas.ar describen a quienes consultaron. No se convierten en una encuesta del parque automotor por acumular muchas filas.

Población objetivo y población observada

Antes de calcular, nombramos dos universos:

No son lo mismo. La estadística anual de DNRPA describe parque activo en condiciones registrales para circular por provincia y mes. Una consulta web es un evento generado por una persona o empresa con una necesidad concreta.

La comparación puede revelar diferencias de composición; no transforma eventos en vehículos únicos ni prueba representatividad.

De dónde nace la autoselección

La probabilidad de consultar puede aumentar si alguien:

También depende de conectividad, conocimiento del servicio y posibilidad de usar el dato solicitado. Esos factores no se distribuyen uniformemente en el parque.

NIST señala que el muestreo no sesgado es clave para obtener muestras representativas. En nuestro caso no asignamos vehículos al azar ni invitamos a una encuesta probabilística.

Definir una consulta válida antes de comparar

El denominador excluye bots, pruebas, replays, errores, timeouts y sesiones incompletas según reglas versionadas. Sólo entran consultas frescas que ejecutaron realmente las fuentes previstas y finalizaron con estado interpretable.

No se suman resultados reutilizados como nuevas observaciones. Si una misma sesión reintenta por un fallo técnico, la metodología evita contarla varias veces.

La unidad sigue siendo consulta, no vehículo. Si un dominio fue buscado en días distintos, puede aportar más de un evento salvo que una investigación defina y justifique deduplicación.

Qué variables podemos comparar

Una comparación requiere la misma definición en ambos lados. DNRPA publica parque activo por provincia y mes. Para contrastarlo, la consulta necesitaría una provincia comparable y obtenida legítimamente.

No inferimos radicación desde el lugar de una infracción ni desde la IP. Tampoco asumimos que el usuario vive donde está el auto. Si la variable no existe con calidad suficiente, se declara ausente.

Otras dimensiones públicas podrían ser tipo de vehículo o antigüedad, pero sólo se usan si categorías, período y cobertura pueden armonizarse sin forzar equivalencias.

Distribuciones, no porcentajes de vehículos con multas

El análisis calcula la participación de cada categoría dentro de las consultas y dentro del marco oficial. Después informa diferencias en puntos porcentuales o razones de representación.

Ejemplo sintético: una región representa 20 % del parque público y 30 % de consultas ficticias. Podemos decir que aparece más en esa muestra de consultas. No podemos concluir que allí haya más multas.

El resultado puede deberse a marketing, cobertura del servicio, hábitos digitales, operaciones de flota o preocupación local. La comparación no identifica la causa por sí sola.

Umbral mínimo y privacidad

Toda celda propia necesita al menos cien casos válidos. Si no llega, se suprime numerador, denominador y porcentaje. El umbral se aplica antes de mirar el resultado.

Además, evitamos tablas que permitan reconstruir celdas por resta y no publicamos patentes, DNI, IP, actas, payloads ni identificadores de sesión. La Ley 17.622 protege el secreto estadístico dentro del sistema oficial; usamos su principio de compilaciones de conjunto como referencia metodológica.

Un agregado grande todavía puede ser sensible si cruza demasiadas dimensiones, por lo que la revisión no termina en el conteo.

Un diagnóstico de diferencias estandarizado

Para cada dimensión comparable, la salida incluye:

  1. fuente y fecha del marco público;
  2. período de consultas;
  3. definiciones y transformaciones;
  4. distribución de ambos universos;
  5. celdas suprimidas;
  6. variables relevantes que no pudimos medir;
  7. conclusión limitada.

Los bins se fijan antes. No se fusionan provincias o categorías sólo porque una diferencia queda incómoda, salvo que la política de privacidad lo exija de manera uniforme.

Ponderar no convierte la muestra en aleatoria

Podemos asignar pesos para que la distribución provincial de las consultas coincida con la del parque. Eso corrige exactamente esa dimensión bajo supuestos definidos.

No corrige variables no observadas: antigüedad, kilometraje, uso comercial, frecuencia de viaje, exposición a cámaras o motivación de consulta. Dos vehículos de la misma provincia pueden tener probabilidades muy distintas de llegar al sitio.

Por eso cualquier resultado ponderado se presenta como análisis de sensibilidad, junto con el resultado sin ponderar. Nunca se vende como “la realidad nacional”.

Duplicación, flotas y dependencia

Una flota puede generar muchas consultas coordinadas. Contarlas como observaciones independientes subestima la dependencia entre eventos. El protocolo identifica, de forma agregada y sin exponer clientes, si una porción importante proviene de operaciones repetidas.

Según la pregunta, se puede estratificar web individual y flota, o limitar la conclusión a un canal. No se elimina una fuente de datos sólo para acercarse al parque.

También registramos cambios de producto o campañas que alteren quién consulta durante el período.

Qué haría falta para estimar una prevalencia nacional

Estimar cuántos vehículos tienen multas requeriría un diseño probabilístico o un marco casi censal, cobertura definida de jurisdicciones, deduplicación por vehículo, tiempos comparables y conocimiento de datos faltantes.

Las consultas voluntarias no cumplen esos requisitos. Incluso una respuesta de todas las fuentes disponibles podría omitir organismos sin integración o actas aún no cargadas.

Por eso no publicamos una prevalencia nacional a partir de esta muestra.

La frase editorial correcta

Cada hallazgo empieza con “entre las consultas completas realizadas en multas.ar durante este período”. Luego explica cómo difiere su composición del parque público y cuáles son los huecos.

La conclusión defendible es: medimos y publicamos el sesgo observable, pero no afirmamos que quienes consultan representen a todos los autos. Reconocer ese límite hace que los datos propios sean más útiles, no menos.

Metodología

Alcance
Protocolo para comparar distribuciones agregadas de consultas web válidas con estadísticas oficiales del parque automotor sin inferir prevalencia nacional de multas.
Unidad de análisis
Una consulta completa válida en multas.ar y una celda agregada comparable con una categoría pública del parque activo.
Cobertura
Fuentes oficiales y metodología revisadas el 14 de agosto de 2026; esta nota no publica resultados propios ni datos de producción.

Limitaciones

Fuentes

Preguntas frecuentes

¿Más consultas hacen que la muestra sea representativa?

No necesariamente. Una muestra muy grande puede conservar sesgo si la decisión de consultar está relacionada con el fenómeno estudiado o con variables no observadas.

¿Se puede ponderar por provincia para corregir todas las diferencias?

No. Ponderar una dimensión conocida puede acercar esa distribución, pero no corrige edad del vehículo, uso, exposición, comportamiento u otras variables ausentes.

¿Se publican patentes para que otro investigador reproduzca el cálculo?

No. La reproducibilidad se logra con reglas, código, agregados permitidos y fixtures sintéticos; no se publican identificadores ni celdas con menos de cien casos.

Notas relacionadas