Why can I tell a test is flaky but never find out why?
Oportunidad
Detecting that a test is flaky is mostly solved; several tools do it reliably across reruns. Diagnosing the specific root cause is not. LLMs evaluated on real-world flaky test datasets achieve F1 scores above 0.88 for detection but drop below 0.57 on the same inputs when asked to identify root cause. The few automated repair tools only handle order-dependent or implementation-dependent flakiness and fail on resource contention, async timing, and environment drift. Developers spend hours reading logs and adding print statements, then watch the failure refuse to reproduce locally.
Por qué importa
Root cause attribution is the missing step that turns a flakiness detector from a dashboard metric into a tool that actually reduces CI time.
Cómo evalúo la oportunidad
La Puntuación de Oportunidad es mi propia lectura, no una medición: cuánto duele, con qué frecuencia aparece y qué tan poco existe para resolverlo hoy. Un valor más alto significa que creo que vale más la pena construirlo.
Cuánto dolor causa cuando aparece.
Con qué frecuencia la gente se topa con ello.
Qué tan pocas herramientas buenas existen para ello hoy.
Más problemas que vale la pena resolver
¿Por qué el software del que más dependemos es el peor de usar?
Tech¿Por qué sigo sin ser dueño de ninguno de los datos que genero?
Tech¿Por qué no puedo obtener un comprobante que demuestre que mis datos fueron realmente eliminados?
Tech¿Por qué no puedo saber si lo que está en ejecución coincide con lo que declaró mi SBOM?
Tech¿Por qué toda cadena de procedencia C2PA se rompe en el momento en que el contenido llega a las redes sociales?
Tech¿Por qué mis pruebas generadas por IA pasan por alto los errores que se suponía que debían detectar?