본문 바로가기

카테고리 없음

토큰 효율은 엔지니어의 역량입니다 - OpenAI DevDay를 보며

9월 29일 OpenAI DevDay에서 20개가 넘는 발표가 나왔습니다.
그중 가장 많은 반응을 얻은 것은 모델이 아니라 요금제였습니다.

월 500달러의 Pro 500 플랜이 새로 생겼습니다.
Plus의 25배 사용량과 함께 Codex에서 초당 300토큰을 내는 Ultrafast 속도 등급이 추가되었습니다.
기존 속도의 최대 8배입니다.

같은 날 월 200달러 플랜의 사용량은 기존 대비 절반으로 줄었습니다.
Work와 Codex 허용량이 Plus의 20배에서 10배가 되고, GPT-6 Pro 채팅은 주당 200회에서 100회가 됩니다.
10월 30일부터 적용됩니다.

저는 이 발표에서 두가지가 눈에 들어왔습니다.
계층화와 토큰 맥시마이징의 수익화입니다.

500달러 플랜이 파는 것은 속도만이 아닙니다.
같은 모델을 쓰더라도 더 많이 그리고 더 빨리 쓰는 사람을 따로 묶어 더 비용을 받겠다는 구조입니다.
그동안 정액제 안에서 토큰을 최대한 뽑아 쓰던 방식이 그 자체로 상위 상품이 됐습니다.
200달러 플랜의 사용량이 절반으로 줄어든 것은 그 경계를 더 선명하게 강화하는 조치입니다.

OpenAI 입장에서는 자연스러운 선택입니다.
GPT-6 Astra 수요가 시스템을 압박해 200달러 플랜 가입을 한동안 중단했던 회사입니다.
가장 많이 쓰는 사용자에게 비용을 더 부담시키는 것은 인프라 관점에서 합리적입니다.

다만 저는 이 흐름을 조금 다른 관점에서 보게 됩니다.

LLM 기반 페어 프로그래밍이 처음 등장했을 때부터 저는 토큰을 최대한 쓰는 방식을 선호하지 않았습니다.
같은 결과를 더 적은 토큰으로 얻는 것이 전문적인 엔지니어의 요소라고 생각해 왔습니다.

이유는 단순합니다.
토큰을 많이 쓴다는 것은 대체로 문제를 충분히 정의하지 않은 채 모델에게 탐색을 맡긴다는 뜻입니다.
컨텍스트를 정리하지 않고 통째로 넣고, 요구사항을 좁히지 않고 여러 번 다시 시키고, 결과를 검토하지 않고 다시 생성합니다.
그렇게 해도 결과는 나옵니다. 그러나 그것은 모델이 잘한 것이지 엔지니어가 잘한 것은 아닙니다.

효율적으로 쓴다는 것은 반대입니다.
무엇을 만들지 먼저 정하고, 모델에게 넘길 부분과 직접 판단할 부분을 나누고, 필요한 맥락만 골라 넣습니다.
결과가 나오면 다시 생성하기 전에 읽고 이해하고 판단합니다.
이것은 도구를 아끼는 습관이 아닌 요청하는 문제를 이해하고 있다는 증거입니다.

Ultrafast 같은 기능은 그 자체로 정말 좋은 기술입니다.
다만 속도가 8배가 되면 잘못된 방향으로 8배 빨리 갈 수도 있습니다.
8배의 속도가 8배의 매출이 아닐 수 있습니다.
무엇을 시킬지가 정리되지 않은 상태에서 속도와 사용량만 늘린다면, 결과적으로 늘어나는 것은 결과물이 아니라 청구서와 비용이 될 수 있습니다.

반응형