Kimi K3, 6시간 자율 실행으로 뭘 만들 수 있을까: Claude Fable 5·GPT-5.6 Sol과 비교
Kimi K3에게 우주 전략 게임을 통째로 맡겨본 결과와, 동일 과제로 Claude Fable 5·GPT-5.6 Sol과 비교한 점수·시간·API 비용을 정리합니다.
Kimi K3에게 우주 전략 게임을 만들어 달라고 했습니다. 프롬프트는 딱 한 번 보냈고, 중간에 제가 개입한 적은 없습니다. 5시간 45분 뒤에 나온 결과물이 이 게임 STARFALL입니다.
함선, 행성, 자원 노드 같은 요소가 전부 코드로 구현되어 있고, 외부 3D 모델이나 텍스처, 음원 파일은 하나도 쓰지 않았습니다. Three.js의 도형과 셰이더, Web Audio만으로 만든 결과물입니다.
이 정도 결과물을 오픈 모델이 혼자서, 그것도 단 하나의 프롬프트로 만들어낼 수 있다는 게 이번 글에서 하고 싶은 이야기의 핵심입니다. 그리고 이 게임 하나로 끝내기는 아쉬워서, Kimi K3와 Claude Fable 5, GPT-5.6 Sol에게 완전히 동일한 두 가지 과제를 맡기고 결과를 비교해봤습니다.
핵심 요약
- Kimi K3는 Moonshot AI가 2026년 7월 17일 정식 공개한 오픈 모델로, 2.8조 파라미터를 지원하는 최초의 오픈 모델이라고 공식 문서에 나와 있습니다. 100만 토큰 컨텍스트 윈도우를 지원하고, 장기간 코딩 작업에 특히 강합니다.
- 과제 1(한국어 카피 모션 포스터)에서는 Kimi K3가 96점으로 가장 높은 점수를 받았고, API 환산 비용도 $3.36으로 가장 저렴했습니다. 다만 작업 시간은 38분으로 셋 중 가장 길었습니다.
- 과제 2(90분 제한 3D 그래플링 게임)에서는 Fable 5가 31분, GPT-5.6 Sol이 51분 14초로 제한 시간 안에 완주했지만, Kimi K3는 90분 안에 끝내지 못했습니다. 다만 시간 제한을 풀어주자 2시간 27분 만에 스스로 문제를 계속 고쳐가며 가장 높은 기술 점수로 완성했습니다.
- 보너스로 진행한 우주 전략 게임 STARFALL은 Kimi K3 혼자, 메인 에이전트와 서브 에이전트 13개를 조합해 5시간 45분 동안 개입 없이 만든 결과물입니다.
- 종합하면 Kimi K3는 단순히 저렴한 모델이 아니라, 한국어 글쓰기와 장시간 자율 작업에서 Fable 5·GPT-5.6 Sol과 충분히 겨룰 만한 품질을 보여줬습니다.
비교 조건
이번 비교는 이렇게 진행했습니다.
- 세 모델 모두 에포트 레벨은 하이로 통일했습니다.
- 모든 작업은 원샷 프롬프트로 진행했습니다. 프롬프트 하나를 보내고, 중간에 한 번도 개입하지 않은 결과입니다.
- 모든 작업에 제한 시간을 두고, 그 기준으로 점수표를 산정했습니다.
- 채점은 제가 정한 자체 기준으로 AI에게 채점을 맡긴 참고용 결과이며, 공식 벤치마크가 아닙니다.
과제 1: 한국어 카피 모션 포스터
첫 번째 과제는 한국어 카피가 들어간 모션 포스터를 만드는 작업이었습니다. 행사 브리프 정도의 최소 정보만 주고, 자연스러운 한국어 카피를 쓰고 포스터 스튜디오를 만들고 한글 자모 애니메이션까지 구현하라고 요청했습니다.
세 모델 모두 한글 자모가 흩어졌다가 합쳐지는 효과, PNG 내보내기, 카피 추가 같은 기능 테스트는 모두 통과했습니다. 카피 세 개를 AI에게 블라인드로 채점을 맡겼을 때도, 제가 직접 골랐을 때도 공통적으로 Kimi K3의 카피가 가장 자연스럽다는 결과가 나왔습니다.
| 모델 | 점수 | 작업 시간 | API 환산 비용 |
|---|---|---|---|
| Kimi K3 | 96 | 38분 | $3.36 |
| Claude Fable 5 | 94 | 20분 | $14.68 |
| GPT-5.6 Sol | 92 | 17분 | $4.26 |
점수는 Kimi K3가 가장 높았지만, 작업 시간은 셋 중 가장 길었습니다. 그런데도 API 비용은 가장 저렴했습니다. 시간을 조금 더 쓰더라도 결과물의 완성도와 비용 모두를 잡은 셈입니다.
과제 2: 90분 제한 3D 그래플링 게임
두 번째 과제는 조금 더 복잡합니다. 브라우저에서 완주할 수 있는 3D 그래플링 게임을 만드는 작업으로, 외부 3D 모델 없이 도로를 만들고 와이어를 걸어 건물 사이를 넘나드는 방식입니다. 체크포인트 다섯 개를 순서대로 통과해야 하고, 추락하면 가장 최근 지점으로 돌아와야 합니다. 제한 시간은 90분으로 뒀습니다.
세 모델 모두 기능적으로는 완성했지만, 완주 시간에서 큰 차이가 났습니다.
| 모델 | 90분 제한 내 결과 | 완주 시간 | 총 토큰 | API 환산 비용 |
|---|---|---|---|---|
| Claude Fable 5 | 완주 | 31분 | 9.86M | $19.14 |
| GPT-5.6 Sol | 완주 | 51분 14초 | 10.44M | $8.04 |
| Kimi K3 | 미완성 | 2시간 27분 24초 | 18.97M | $9.06 |
Fable 5와 GPT-5.6 Sol은 제가 만들어 둔 하드 게이트(체크포인트 순차 통과, 필수 그래플, 골인 타이머 등)를 90분 안에 모두 통과했습니다. Kimi K3는 90분 시점에서는 체크포인트 다섯 개를 순서대로 통과하지 못해 미완성으로 판정했습니다.
다만 흥미로운 지점은 여기서부터입니다. 90분이 지난 뒤에도 Kimi K3는 아무런 추가 지시 없이 스스로 계속 문제를 찾아 고쳤고, 결국 2시간 27분 만에 모든 게이트를 통과했습니다. 제한 시간이 없다고 가정하고 기술 점수를 다시 매겼을 때는 Kimi K3가 가장 높은 점수를 받았습니다. 90분 제한 안에서는 순위에 들지 못했지만, 장기간 스스로 오류를 고치며 완성도를 끌어올리는 능력만큼은 확실히 보여준 셈입니다.
비용 면에서는 셋 중 Fable 5가 가장 비쌌고, Kimi K3와 GPT-5.6 Sol이 상대적으로 저렴했습니다. Kimi K3의 단가가 낮다는 점은, 모델이 더 오래 스스로 시도하고 고칠 여유를 준다는 뜻이기도 합니다. 마감이 정해진 작업이라면 빠르게 끝내는 모델을 고르는 게 맞지만, 시간에 여유가 있고 비용을 낮추면서 완성도를 높이고 싶다면 Kimi K3도 괜찮은 선택지입니다.
보너스: Kimi K3 혼자 만든 우주 전략 게임 STARFALL
앞의 두 과제로 세 모델을 비교하는 건 여기서 끝났지만, Kimi K3의 장기간 자율 실행 능력과 서브 에이전트 활용 능력을 좀 더 보여드리고 싶어서 별도로 실험을 하나 더 했습니다. 우주 RTS 게임을 트리플 A 퀄리티로 만들어 달라고 요청하고, 서브 에이전트를 여러 개로 나눠 각 항목을 개별적으로 맡기고 시각적으로 직접 검증하게 하라는 프롬프트를 보냈습니다.
Kimi K3가 가장 먼저 한 일은 CONTRACTS.md 파일을 만들어 파일 소유권, 공유 API, 완료 조건을 정리하는 것이었습니다. 그다음 카메라, 월드, 함선, 전투 이펙트, 게임 로직, UI를 도메인별로 나눠 서브 에이전트에게 병렬로 맡겼습니다.
최종적으로 서브 에이전트 13개를 구성했습니다. 초기 구현에 6개, 비평 담당 에이전트 1개, 1차 수정에 3개, 2차 수정에 3개를 썼고, 매 수정 단계마다 Playwright로 실제 실행 화면을 캡처해 시각적으로 검증했습니다. 첫 결과물이 완벽하지는 않았지만, 별도 비평 에이전트가 문제를 찾아 담당 에이전트에게 다시 던져주는 과정을 세 번 정도 반복한 끝에 지금의 완성본이 나왔습니다.
Kimi K3가 이 과정에서 스스로 설계한 하네스 구조를 그림으로 정리하면 이렇습니다.
이 모든 과정에 걸린 시간은 약 5시간 45분이었고, 저는 프롬프트 하나만 보내고 한 번도 개입하지 않았습니다. 초기 자원 노드는 다소 엉성했는데, 최종본에서는 디테일이 상당히 살아있는 모습으로 완성됐습니다. 조금만 더 다듬으면 실제 상용 게임 수준으로 쓸 수 있을 정도입니다. Claude나 GPT 계열이 아닌 오픈 모델이 이 정도 결과물을 혼자 만들어낼 수 있다는 건, 오픈 모델의 발전 속도를 보여주는 사례라고 생각합니다.
정리
한국어 카피 작업에서는 개인적으로 Kimi K3, Fable 5, GPT-5.6 Sol 순으로 점수를 매겼고, API 비용에서도 Kimi K3가 가장 낮았습니다. 3D 게임 작업에서는 Kimi K3가 90분 제한 안에는 완성하지 못했지만, 제한을 풀었을 때는 가장 높은 점수를 받았습니다. 이 점수는 제가 정한 기준으로 채점한 참고용 결과이니 그 점은 감안해서 봐주시면 좋겠습니다.
실제로 이번 영상을 준비하면서, 그리고 제 업무에서도 Kimi를 써본 소감은 이렇습니다. 단순히 가격만 낮춘 모델이 아니라, 한국어 글쓰기와 시각적 결과물, 그리고 긴 자율 수행 과정에서 Fable이나 GPT Sol과 충분히 겨룰 만한 품질을 보여줬습니다. 특히 코딩 작업이 길고, 프로젝트 규모가 크고 시각 요소가 많아서 여러 번 시도하며 비용을 관리하고 싶은 분들께는 잘 맞을 것 같습니다.
자주 묻는 질문
Kimi K3는 어떤 모델인가요?
Moonshot AI가 2026년 7월 17일 정식 공개한 오픈 모델로, 100만 토큰 컨텍스트 윈도우를 지원하고 장기간 코딩 작업에 강합니다.
Kimi K3가 혼자 만든 게임 STARFALL은 어떻게 만들어졌나요?
프롬프트 하나로 개입 없이 약 5시간 45분 동안 제작했습니다. CONTRACTS.md로 역할을 나누고 서브 에이전트 13개를 구성해, 비평 에이전트와 Playwright 화면 검증으로 수정을 반복했습니다.
세 모델 비교는 어떤 조건에서 진행됐나요?
세 모델 모두 에포트 레벨 하이, 원샷 프롬프트, 중간 개입 없음, 제한 시간 기준으로 진행했습니다. 점수는 자체 기준으로 AI가 채점한 참고용 결과이며 공식 벤치마크가 아닙니다.
Kimi K3는 어떤 작업에 잘 맞나요?
코딩 작업이 길고 프로젝트 규모가 크며 시각 요소가 많아, 여러 번 시도하면서 비용을 관리하고 싶은 경우에 잘 맞습니다. 마감이 정해진 작업이라면 빠르게 끝내는 모델이 낫습니다.
이 글이 도움이 됐나요?
좋았다면 링크를 공유하거나 반응을 남겨주세요. 남겨주신 반응은 다음 글을 개선하는 데 참고하겠습니다.

