Why can I tell a test is flaky but never find out why?
Cơ hội
Detecting that a test is flaky is mostly solved; several tools do it reliably across reruns. Diagnosing the specific root cause is not. LLMs evaluated on real-world flaky test datasets achieve F1 scores above 0.88 for detection but drop below 0.57 on the same inputs when asked to identify root cause. The few automated repair tools only handle order-dependent or implementation-dependent flakiness and fail on resource contention, async timing, and environment drift. Developers spend hours reading logs and adding print statements, then watch the failure refuse to reproduce locally.
Tại sao quan trọng
Root cause attribution is the missing step that turns a flakiness detector from a dashboard metric into a tool that actually reduces CI time.
Cách tôi đánh giá cơ hội
Điểm Cơ Hội là đánh giá riêng của tôi, không phải một phép đo chính xác: mức độ gây khó chịu, tần suất xuất hiện và sự khan hiếm của giải pháp hiện có. Điểm càng cao, tôi càng cho rằng vấn đề đó càng đáng để xây dựng.
Mức độ phiền toái nó gây ra khi xuất hiện.
Tần suất mọi người thực sự gặp phải nó.
Có rất ít công cụ tốt để xử lý nó hiện nay.
Thêm các vấn đề đáng giải quyết
Tại sao phần mềm mà chúng ta phụ thuộc nhiều nhất lại là phần mềm tệ nhất để sử dụng?
TechTại sao tôi vẫn không sở hữu bất kỳ dữ liệu nào mình tạo ra?
TechTại sao tôi không thể nhận được biên lai chứng minh dữ liệu của tôi đã thực sự bị xóa?
TechTại sao tôi không thể biết liệu những gì đang chạy có khớp với những gì SBOM của tôi đã khai báo không?
TechTại sao mỗi chuỗi xuất xứ C2PA đều bị phá vỡ ngay khi nội dung lên mạng xã hội?
TechTại sao các bài kiểm thử do AI tạo ra lại thông qua với chính những lỗi mà chúng được tạo ra để phát hiện?