본문 바로가기

일과 생각

에이전트는 문제를 풀 줄 알지만 시간을 쓸 줄은 모릅니다

"앞으로 1시간 동안 이 코드를 계속 테스트하면서 완성도를 끝까지 끌어올려 줘."

 

에이전트에게 이런 지시를 내리면 무슨 일이 일어날까요.

보통 위처럼 요청 시 에이전트가 1시간 내내 결과물을 다듬을 것으로 기대하고 요청합니다.

10월 7일 arXiv에 올라온 논문 하나가 그 기대를 실험으로 확인했습니다.

 

독일 튀빙겐 AI 센터 연구진이 발표한 논문 "AgentTime: Can Agents Estimate and Control Their Own Runtime?"입니다.

코딩, 컴퓨터 사용, 에이전트 업무, 자동화 연구 등 18개 벤치마크에서 뽑은 222개 과제를 기반으로 에이전트가 요청받은 시간만큼 일할 수 있는지, 자기 작업 시간을 예측할 수 있는지, 끝난 뒤 얼마나 걸렸는지 이해하고 있는지를 측정했습니다.

Claude Code의 Fable 5.1과 Codex의 GPT-6 Astra, GPT-5.6 Sol 등이 대상이었고, 총 1,991회를 진행했습니다.

 

결과를 보면 사람이 일할 때 겪는 상황이 에이전트에게도 그대로 나타납니다.

 

사용하는 모델에 따라 시간 감각의 차이가 큽니다.

요청한 시간의 ±5% 안에 끝낸 비율이 GPT-6 Astra는 63%, GPT-5.6 Sol은 39%, Fable 5.1은 4%였습니다.

Fable 5.1은 요청 시간에서 평균 2.9배 벗어났고, Astra는 1.2배였습니다.

하네스를 서로 바꿔 돌려도 이 차이는 유지됐습니다.

 

실험에서 Fable의 행동 패턴이 인상적이었습니다.

"1분 안에 빠르게 끝내주세요"라고 하면 10분 넘게 고민하다 늦게 나옵니다.

"1시간 동안 깊게 파고들어 주세요"라고 하면 5분 만에 다 풀었다며 스스로 종료합니다.

짧게 시키면 길게, 길게 시키면 짧게 일하는 셈입니다.

 

시간을 맞추어 요청한 모델도 그 시간을 일에 쓴 것은 아니었습니다.

63%를 맞춘 Astra의 실행 기록을 들여다보니 다른 장면이 나왔습니다.

10분에서 20분 만에 초안을 끝낸 뒤, 요청받은 1시간을 채우기 위해 터미널에 sleep 명령을 걸어두고 기다리거나, 이미 끝난 코드를 의미 없이 열고 닫으며 시간을 보내는 경우가 다수 확인되었습니다.

겉으로는 시간을 지켰지만 실제로는 요청에 맞추어 불필요한 자리만 지킨 것입니다.

 

시간을 더 주고 요청해도 결과가 좋아지지 않았습니다.

원래 걸리는 시간의 16배를 주었을 때 결과물 점수가 유의미하게 오른 경우는 23%에서 25% 사이에 그쳤습니다.

약 63%는 10분을 주든 160분을 주든 응답 결과물의 점수는 같았습니다.

에이전트가 스스로 어디를 더 보완해야 할지 모른다면 시간은 품질이 되지 않았습니다.

 

예측 능력도 함께 측정했습니다.

두 모델 모두 작업 전에 걸릴 시간을 묻자 실제보다 2.6배에서 2.9배 길게 예측했습니다.

중앙값으로 15분을 예측하고 10분에서 13분 만에 끝냈습니다.

흥미로운 것은 두 모델이 자신을 "프론티어 AI 에이전트보다 약간 빠르고 숙련된 사람보다 네 배 빠르다"고 여긴다는 점입니다.

 

저는 이 결과가 세 가지를 보여준다고 생각합니다.

 

첫째, 문제를 푸는 능력과 시간을 쓰는 능력은 다른 능력입니다.

벤치마크에서 Astra와 Fable 5.1은 거의 같은 점수를 냅니다.

그런데 시간을 지키는 능력에서는 63%와 4%로 갈립니다.

모델이 똑똑하다는 것과 모델이 자기 자원을 계획적으로 쓴다는 것은 별개의 문제입니다.

우리는 보통 전자만 보고 후자까지 될 것이라고 가정합니다.

 

둘째, 에이전트에게 시간을 주는 지시는 아직 작동하지 않습니다.

"1시간 동안 다듬어라"는 지시는 사람에게는 자연스럽습니다.

에이전트에게는 그 지시가 "1시간 뒤에 끝내라"로 번역되거나 "할 만큼 하고 끝내라"로 번역됩니다.

어느 쪽도 우리가 원한 것이 아닙니다.

시간을 기준으로 위임하는 방식 자체가 지금 에이전트에게는 맞지 않습니다.

 

셋째, 에이전트 요청 시 위임의 단위를 바꿔야 합니다.

루프를 구성할 때 시간 대신 조건을 지정해야 합니다.

"1시간 동안 테스트하라"가 아니라 "이 테스트 케이스가 모두 통과할 때까지"나 "이 세 가지 기준을 만족할 때까지"로 지시하는 것이 필요합니다.

에이전트가 스스로 어디를 더 보완할지 모른다면, 그 판단을 사람이 조건으로 미리 적어 주는 수밖에 없습니다.

하네스 엔지니어링 글에서 다룬 것과 같은 결론입니다. 에이전트가 할 일을 정하는 것은 여전히 사람의 설계입니다.

 

많은 팀이 에이전트를 도입하면서 모델의 발전에 따라 알아서 오래 고민하고 좋은 결과를 가져올 것이라고 기대합니다.

기대에 대해 논문은 어느 부분이 틀렸는지를 실험을 통해 확인했습니다.

에이전트는 문제를 풀 줄 압니다. 다만 시간을 쓸 줄은 아직은 모릅니다.

반응형