AI
AI 어시스턴트가 작성한 코드가 실제로 올바른지 어떻게 알 수 있는가?
85
기회
LLM은 단위 테스트는 통과하지만 어떠한 공식적 속성도 충족하지 않는 코드를 생성한다. 모델은 로직이 맞아서가 아니라 구성적으로 통과하는 테스트를 만들 수 있다. 형식 검증 도구는 존재하지만 정리 증명기 구문으로 명세를 작성해야 하는데, 실제로 일하는 개발자 중에서 이를 하는 사람은 거의 없다. 최근 벤치마크에 따르면 프론티어 모델은 엔드투엔드 검증 가능한 코드 생성에서 3.2%의 성공률만을 달성하며, 이는 그럴듯해 보이는 코드와 검증된 올바른 코드 사이의 격차가 거의 완전히 열려 있다는 것을 의미한다. AI가 작성한 코드를 프로덕션에 출시하는 팀들은 모델 자체가 조작할 수 있는 테스트 커버리지에 베팅하고 있는 셈이다.
왜 중요한가
AI 생성 코드에 대한 자동화된 정확성 보장이야말로 코딩 어시스턴트를 속도 도구에서 신뢰성 도구로 전환하는 것이다.
기회 평가 방식
기회 점수는 측정값이 아닌 제 주관적 평가입니다. 얼마나 불편한지, 얼마나 자주 발생하는지, 현재 해결책이 얼마나 부족한지를 반영합니다. 점수가 높을수록 만들 가치가 더 높다고 생각합니다.
심각도8/10
발생했을 때 얼마나 큰 불편을 초래하는지.
빈도9/10
실제로 얼마나 자주 접하게 되는지.
공백 영역8/10
현재 이를 해결할 만한 도구가 얼마나 부족한지.