Ir al contenido principal
← Todas las novedades

1.565× más rápido: los benchmarks de Radar DataTree están en revisión

En algún lugar aguas arriba, una tormenta se intensifica. La pregunta sobre la mesa es simple: ¿cuánta lluvia ha caído sobre esta cuenca en las últimas seis horas — y cómo se compara con los eventos que causaron inundaciones antes? La respuesta existe. Está guardada en un archivo de radar meteorológico. Que llegue a tiempo es otro asunto.

Toda decisión meteorológica tiene una ventana. Una alerta de inundación, la operación de un embalse, una ruta de aviación, el plazo de una investigación — cada una se cierra, llegue o no la información. Y con demasiada frecuencia los datos pierden la carrera: no porque los radares no observaran, sino porque el archivo no puede responder preguntas. Solo puede entregarle archivos.

El cuello de botella no es la ciencia

En un flujo de trabajo típico basado en archivos, responder una pregunta de un solo día sobre una tormenta significa localizar decenas de archivos Level II, descargarlos, decodificar cada uno, reconstruir la línea de tiempo en su propio código — y solo entonces hacer la ciencia. En nuestro benchmark, la ciencia en sí tomó segundos. Casi todo lo demás fue preparación. Ese costo es estructural: se repite para cada científico, cada pregunta, cada vez.

Qué medimos

Ese es el problema que Radar DataTree nació para eliminar — y los números ya están escritos: nuestro artículo (Ladino, Nesbitt, Grover, Galewsky y Mühlbauer) está en revisión en IEEE Transactions on Big Data. La idea en una frase: abrir todo un archivo de radar como un solo conjunto de datos nativo de la nube e indexado en el tiempo — hacerle preguntas directamente, en lugar de descargar y decodificar miles de archivos.

Un día de análisis de tormenta — misma tarea, dos flujos de trabajo
Archivos clásicos 308,5 s
Radar DataTree 6,5 s

48× más rápido de extremo a extremo, moviendo 5,8× menos datos (809 MB → 139 MB). La misma entrada, la misma ciencia — los perfiles de la tormenta salen idénticos.

48× es la diferencia entre un análisis con pausa de café y uno interactivo. Cuando un día de estructura de tormenta toma 6,5 segundos en lugar de cinco minutos, usted deja de racionar sus preguntas: prueba cinco hipótesis antes del almuerzo, repite con otros umbrales, sigue los datos a donde lo lleven.

Y la ventaja crece con la pregunta. Los totales de lluvia sobre seis meses de archivo — 37.321 archivos, ~184 GB — corren 1.565× más rápido, porque el conjunto de datos lee solo los fragmentos exactos que cada consulta toca, sin importar cómo quedaron empacadas las observaciones en archivos.

Cuanto más largo el archivo, mayor la ventaja
1 día 112×
7 días 545×
30 días 1.193×
6 meses 1.565×

Aceleración de extremo a extremo frente al flujo basado en archivos (estimación de lluvia, archivo KVNX en AWS). Sin trucos de caché — la misma ciencia, distinta tubería.

Y lo esencial: nada científico cambió. Reprodujimos un análisis canónico de la tormenta del 20 de mayo de 2011 en Oklahoma y los perfiles salen idénticos — la misma entrada, la misma física, distinta tubería.

Por qué nos importa

Este es el corazón de lo que hace AtmoScale. Nos importa que los datos estén listos dentro de la ventana de decisión — mientras el pronóstico de inundación todavía es accionable, el estudio todavía es financiable, la pregunta todavía vale la pena. Y lo hacemos sobre fundamentos abiertos y alineados con los estándares: Radar DataTree sigue el modelo de datos FM301 de la OMM — no reemplazamos el estándar, lo extendemos a la nube — y se construye sobre Zarr, Icechunk y xarray, para que su institución nunca dependa de nosotros, ni de nadie, para leer su propio archivo. Los datos ya son valiosos. Nuestro trabajo es que respondan a tiempo, y que usted sea quien los controle.

Conozca el modelo de datos → Pida el preprint →
manténgase al día

Los nuevos datos y resultados aparecen aquí primero.

Siga el trabajo en GitHub, o hablemos de su propio archivo.