AI Neo Lab
무료 AI 도구

AI 의사결정 모델 성능, 팩맨으로 100판 돌려서 순위 매긴 벤치마크

여러 AI 의사결정 모델(jev, kev, clef, GPT-6 등)의 실시간 판단 능력을 비교할 객관적 지표가 부족했습니다. 팩맨 게임을 표준 벤치마크로 삼아 각 모델당 100게임씩 진행하고 점수를 순위표로 공개했습니다. 이 자료는 직접 모델을 테스트해 순위에 올리는 방법과 사람이 직접 고스트를 조종해 AI와 대전하는 법까지 안내합니다.

AI가 '생각'하는 속도와 판단력을 어떻게 수치로 비교할 수 있을까요? Opper.ai가 팩맨이라는 고전 게임을 무대로 주요 경량 의사결정 모델들을 100번씩 돌려 실전 순위를 매겼습니다. 오픈소스 저장소와 무료 크레딧까지 제공하니 내 모델로 직접 도전해 볼 수도 있습니다.

Jevman 벤치마크란 무엇인가요

Jevman 벤치마크는 Pac‑Man 게임을 표준 환경으로 삼아 AI 의사결정 모델들의 지연 시간과 판단력을 비교하는 시험입니다. Pac‑Man은 움직임이 빠르고 상황 판단이 자주 요구되기 때문에, 실시간 의사결정이 얼마나 정확하고 신속한지 평가하기에 적합합니다.

벤치마크는 각 모델을 100번씩 게임에 투입하고, 점수와 평균 응답 속도를 기록해 리더보드를 만들며, 결과와 코드를 모두 오픈소스로 공개합니다. 현재 테스트에 포함된 모델은 jev 1.13, kev, clef, clef flash, GPT‑6 Luna, Laya이며, 모두 Opper 플랫폼을 통해 저렴한 비용(게임당 약 2 센트)으로 실시간 플레이가 가능합니다.

  • jev 1.13
  • kev
  • clef
  • clef flash
  • GPT‑6 Luna
  • Laya

벤치마크에 참여하고 싶다면 GitHub에 공개된 리포지터리를 클론한 뒤, 자신만의 모델을 동일한 100게임 환경에 넣어 결과를 제출하면 됩니다. 이렇게 하면 전 세계 다른 참가자들과 직접 순위를 겨룰 수 있어, 모델 개선에 실질적인 피드백을 받을 수 있습니다.

왜 팩맨으로 AI 의사결정을 테스트하나요

AI 의사결정 모델을 평가할 때 가장 중요한 기준은 얼마나 빨리, 얼마나 정확하게 판단하느냐다. 팩맨은 미로 안에서 유령을 피하면서 점수를 먹어야 하므로 실시간 회피·추격 전략이 동시에 필요하다. 화면이 1초에 수십 번 갱신되는 동안 모델은 매 프레임마다 ‘어디로 움직일지’를 결정해야 하므로, 지연 시간이 길면 즉시 게임오버가 된다.

평가 포인트 3가지

항목일반 LLM 벤치마크팩맨(Jevman)
평가 방식정답률·퍼플렉시티점수·생존 시간·지연 분포
전략 깊이단발성 추론다단계 회피·추격 계획

참가 모델과 100게임 순위표 결과

Jevman 벤치마크에는 현재 6개 모델이 참가했습니다. 각 모델은 똑같은 미로·유령 조건에서 100판씩 플레이했고, 평균 점수와 표준편차로 순위를 매겼습니다.

직접 플레이하며 AI 고스트와 대전하기

웹 브라우저에서 직접 팩맨을 조작하며 AI 고스트와 실시간으로 대결할 수 있습니다. <strong>Jevman 벤치마크 페이지</strong>에 접속하면 사람 플레이어가 팩맨이 되고, 선정된 모델들(jev, kev, clef, clef flash, GPT-6 Luna, Laya)이 유령이 되어 쫓아오는 대전 모드를 바로 체험할 수 있어요.

대전 모드 시작하기

  1. 벤치마크 페이지 열기

    https://opper.ai/jevman-benchmark/ 에 접속합니다.

  2. ‘Play as Pac-Man’ 버튼 클릭

    화면 상단의 대전 모드 진입 버튼을 누르면 게임 화면이 로드됩니다.

  3. 키보드로 조작

    방향키(또는 WASD)로 팩맨을 움직여 점수를 먹으며 유령을 피하세요.

  4. 모델 조합 선택

    단일 모델 고스트 또는 여러 모델이 섞인 ‘혼합 모드’ 중 원하는 구성을 고를 수 있습니다.

  5. 결과 확인

    게임 종료 후 본인 점수와 해당 모델들의 추적 경로를 리플레이로 복기할 수 있습니다.

항목내용
실행 환경Opper 플랫폼 호스팅
무료 크레딧신규 가입 시 자동 지급
지원 모델jev 1.13, kev, clef, clef flash, GPT-6 Luna, Laya
소스 코드github.com/opper-ai/jevman-benchmark

직접 플레이해보면 저렴한 비용으로 다양한 의사결정 모델의 반응 속도와 판단력을 체감할 수 있습니다. 특히 <strong>jev</strong> 모델의 하이스코어를 넘기는 것이 꽤 도전적이라 반복 플레이하며 전략을 다듬는 재미가 있습니다.

운영 환경·비용·한계점 주의사항

Jevman 벤치마크에 참가한 모든 모델은 Opper 인프라 위에서 구동됩니다. 따라서 모델 자체의 연산 속도뿐만 아니라 네트워크 왕복 지연(RTT)이 최종 응답 시간에 그대로 반영됩니다. 로컬에서 모델을 돌릴 때보다 지연이 더 크게 나타날 수 있으니, 실제 서비스에 적용할 때는 이 점을 감안해 타임아웃과 재시도 정책을 설계하세요.

운영 시 체크리스트

알려진 한계점

항목설명
단일 미로·유령 패턴현재 벤치마크는 고정된 미로 1종과 봇 유령 4마리만 사용하므로, 일반화 성능을 장담하기 어렵습니다.
점수 중심 평가생존 시간, 회피 성공률, 경로 효율 등 세부 지표는 별도 수집 스크립트를 만들어야 합니다.
Opper 종속성벤치마크 코드 자체는 오픈소스지만, 모델 추론 엔드포인트는 Opper 전용이라 타 클라우드로 바로 이식하려면 어댑터 구현이 필요합니다.
  1. 크레딧 잔액 확인매일

    Opper 대시보드 → Billing → Credits 에서 잔여 금액과 예상 소진일을 확인하세요.

  2. 알림 설정최초 1회

    Settings → Notifications 에서 ‘크레딧 10% 미만’ 알림을 켜두면 갑작스러운 과금 전환을 방지할 수 있습니다.

  3. 로그 내보내기 자동화주 1회

    opper logs export --since 7d --format jsonl > logs/week-$(date +%F).jsonl 명령으로 주간 로그를 백업하세요.


이런 글도 있어요