AI Neo Lab
AI 트렌드

GPT-6.1 Sol·Sonnet 5.5 등장, 비용-성능 지형도 바꾸다

OpenAI와 Anthropic의 차세대 모델이 동시에 출시되면서 LLM 가격 대비 성능 기준이 대폭 상향되었습니다. GPT-6.1 Sol은 기존 최상위 모델 대비 39% 저렴하면서도 코딩 벤치마크에서 더 높은 점수를 기록했고, Sonnet 5.5는 에이전트 아레나 1~3위를 독식하며 실무 자동화 강자임을 입증했습니다. 이 자료는 두 모델의 벤치마크 수치와 함께 의사결정 모델, 오픈소스 에이전트 도구, 하드웨어 연동 소식까지 최신 AI 생태계 변화를 한눈에 정리합니다.

10월 1~2일 이틀간 AI 업계에서 가장 뜨거웠던 소식은 단연 차세대 플래그십 모델들의 동시 출시였습니다. GPT-6.1 Sol과 Sonnet 5.5가 비용-성능 곡선을 아래로 당기면서, 개발자와 기업은 더 적은 예산으로 더 강력한 자동화 에이전트를 구축할 수 있게 됐습니다. 이 글은 Latent.Space AINews가 선별한 핵심 지표와 함께, 함께 떠오른 의사결정 모델·오픈웨이트·에이전트 하네스 소식을 6개 섹션으로 압축해 전달합니다.

GPT-6.1 Sol: ‘좋고 싸고 빠른’ 새 기준선

모델입력($/1M)출력($/1M)비고
GPT-6.1 Sol210신규 베이스라인
GPT-6 Astra1050직전 플래그십

성능 지표도 인상적입니다. DeepSWE v1.1에서 GPT-6 Sol 대비 +6.4점, AutomationBench에서 Opus 5.5 대비 +2.2점을 기록했습니다. 특히 Agent Arena에서 Sol [Max] 가 중앙값 $0.56/태스크로 5위(+11.23%)에 진입했는데, 이는 GPT-6 Sol보다 39% 저렴하면서 1.52점 높고, Astra보다는 81% 저렴하면서 1.04점 차이에 불과한 가성비 극대화 결과입니다.

동시에 출시된 Sonnet 5.5 [Max] 는 Agent Arena 3위(+12.5%), Chat 카테고리 1위를 차지했습니다. 태스크당 $2.74로 Opus 5.5($1.58)보다 비싸 Pareto 최전선에는 들지 못했지만, Astra [Max] 대비 2점 차이로 80% 저렴해 실무 투입 매력이 큽니다. Anthropic 모델이 Agent Arena 톱 3를 독점한 점도 눈에 띕니다.

  1. Sol 즉시 테스트하기1분

    OpenAI Playground 또는 API에서 gpt-6.1-sol 모델 선택 후 codemode 프롬프트(예: "이 레거시 React 클래스 컴포넌트를 훅 기반 함수형으로 변환해줘")를 던져보세요.

  2. 비용 모니터링지속

    사용량 대시보드에서 1M 토큰당 $2/$10 청구 내역을 확인하며 Astra 대비 절감액을 추적하세요.

자주 묻는 질문(FAQ)

Q: Sol과 'GPT-6 Astra Lite'는 같은 모델인가요? A: 커뮤니티(@scaling01)는 동일 모델로 추측하지만, OpenAI 공식 확인은 아직 없습니다.

Q: Sonnet 5.5가 Opus 5.5보다 비싼데 왜 쓰나요? A: Agent·코딩 벤치마크에서 성능 격차가 커, 고난도 자동화 태스크에서는 총비용(토큰×가격+재시도)이 더 낮을 수 있습니다.

10월 2일 오전 10시(PT)에는 전역 Codex 사용량 리셋이 예정돼 있으니, 새 할당량으로 Sol·Sonnet 5.5를 바로 실험해보기 좋은 시점입니다. "비싸야 좋다"는 공식을 깬 두 모델이 당분간 비용-성능 지형도를 다시 쓸 전망입니다.

비교 한눈에 보기: 비용-성능 파레토 프런티어 이동

비용‑성능 파레토 프런티어가 새 모델 등장으로 크게 이동했어요. 아래 표는 주요 모델을 태스크당 비용, 점수 차이, 순위로 정리한 것이에요. 비용은 평균 비용을 기준으로 하고, 점수 차이는 DeepSWE v1.1·AutomationBench 등에서 기존 모델 대비 상승한 포인트를 나타냅니다.

모델태스크당 비용점수 차이순위
GPT‑6.1 Sol$0.56+1.52 점 (GPT‑6 Sol 대비), +6.4 점 DeepSWE v1.1#5 (+11.23%)
Astra$10/$50 per million 토큰——
Sonnet 5.5$2.74+2.2 점 AutomationBench (Opus 5.5 대비)#3 (+12.5%)
Opus 5.5$1.58—#2
  • 프로젝트 요구에 맞는 토큰 사용량을 확인하세요.
  • 실시간 응답 속도가 중요하면 ‘good, cheap AND fast’이라고 평가받은 Sol을 고려해 보세요.
  • 채팅 중심 서비스라면 순위 1위인 Sonnet 5.5가 최적입니다.

의사결정 모델·오픈웨이트: Jev·Kev·Clef·MiMo 동향

최근 오픈웨이트 기반 의사결정 모델이 빠르게 확산되고 있어요. Jev, Kev, Clef, MiMo 등은 ‘경량 추론·제로샷 분류·로컬 서빙’이라는 새로운 패러다임을 제시합니다. @mervenoyann은 이를 “zero‑shot classifier의 리브랜딩”이라고 부르며, 실제 성능 차이도 뚜렷합니다. Perplexity가 공개한 pplx‑decider‑v1‑27b는 11개 벤치마크에서 평균 85.7% 점수를 기록해 Jev를 앞섰다고 합니다. Jev‑style 캘리브레이션은 가치(value)와 Q‑function 예측과 연결된다는 블로그 포스트도 있어, 강화학습·RLHF와도 자연스럽게 이어질 수 있음을 시사합니다.

각 모델의 라이선스와 크기도 중요한 선택 기준이 됩니다. Jev은 3.66 B 파라미터 규모로 Granite 4.2에서 포스트‑트레인됐으며, Q4 GGUF 파일 크기는 2.09 GiB, 비상업적 라이선스를 적용합니다. Kev 1.0은 로컬 서빙을 위한 엔드포인트가 제공돼 llama serve -hf ggml-org/Kev-4B-GGUF 명령어로 바로 실행할 수 있습니다. Clef는 이제 Ollama에서 배포되고, Reka는 Apache 2.0 라이선스 하에 역동역학(inverse dynamics) 모델을 공개했으며, 게임 데이터로 학습돼 실제 비디오에서도 모터와 카메라 동작을 추출합니다. MiMo‑V2.6‑Pro는 Agent Arena에 #5로 진입해 오픈 모델 중 경쟁력을 입증했습니다.

터미널에서 실행
llama serve -hf ggml-org/Kev-4B-GGUF
모델파라미터라이선스주요 성능
Jev3.66 B비상업적Granite 4.2 기반, formal logic에서 Qwen3‑8B와 비슷
Kev‑1.04 B오픈(ggml‑org)로컬 서빙 엔드포인트 제공
Clef—Ollama 배포zero‑shot 분류 재브랜딩
MiMo‑V2.6‑Pro—오픈 모델Agent Arena #5 진입
Reka 역동역학—Apache 2.0게임·영상 일반화, 모터·카메라 액션 추출
  1. Jev 모델 로컬에 다운로드

    ggml‑org에서 Q4 GGUF 파일(2.09 GiB)을 받아 비상업적 조건에 따라 사용합니다.

  2. Kev 로컬 서빙 시작

    llama serve -hf ggml-org/Kev-4B-GGUF 명령을 실행하면 HTTP 엔드포인트가 열립니다.

  3. Clef를 Ollama에 연결

    Ollama 앱에서 모델 이름을 검색해 바로 호출할 수 있습니다.

에이전트 하네스·하드웨어: Dot·DeepSeek·Meta·Pi 업데이트

에이전트 하네스와 하드웨어 쪽에서도 눈에 띄는 변화가 이어지고 있습니다. OpenAI의 Sam Altman이 가장 좋아한다는 Dot는 일일이 학습하면서 사용자의 워크플로에 맞게 점점 똑똑해진다고 합니다. Dot은 여러 앱 사이에서 컨텍스트를 유지하고, Codex 작업을 조율하며, 주의가 필요한 항목을 자동으로 표시해 줍니다.

DeepSeek는 macOS와 Windows용 데스크톱 빌드를 새롭게 배포했으며, Linux 사용자는 별도 설치가 가능합니다. Meta는 ESP32용 펌웨어와 Muse와 연동되는 리눅스 SDK를 오픈소스로 공개했고, 구독자에게는 5,000대 한정으로 스마트홈 브리지(무료)를 제공하고 있습니다. Pi는 이번에 Cloudflare Durable Objects 위에서 동작하도록 agents SDK v0.26.0과 함께 업데이트됐고, Pi v1.0도 동시에 출시되었습니다. 또한 Pi를 텔레그램 게이트웨이와 연결해 어떤 모델이든 사용할 수 있는 DIY 클론도 소개되었습니다.

제품주요 업데이트
Dot컨텍스트 유지·Codex 작업 조율·주의 항목 플래그
DeepSeek HarnessmacOS·Windows 데스크톱 빌드, Linux 설치 제공
MetaESP32 펌웨어·Linux SDK 오픈소스, 스마트홈 브리지 5,000대 무료
PiCloudflare Durable Objects 지원·agents SDK v0.26.0·Pi v1.0 출시·텔레그램 게이트웨이 DIY
  • 멀티앱 작업 자동화
  • 데스크톱 환경에서 바로 코드 실행
  • 스마트홈 기기와 AI 연동
  • 클라우드 기반 에이전트 배포

주의할 점·다음 주 체크포인트

이번 주 공개된 GPT-6.1 Sol과 Sonnet 5.5가 비용-성능 지형도를 크게 흔들었지만, 실무 적용 전 반드시 확인해야 할 불확실성도 적지 않습니다. 자료에 등장하는 루머·라이선스·벤치마크 한계 등을 한곳에 모아 체크리스트로 정리했습니다.

벤치마크 해석 시 주의할 점

  • WeirdML v3·Design Arena·Vals 등 인용된 벤치마크 다수가 ‘결과가 불완전(incomplete)’하다고 자료 스스로 밝힘
  • Agent Arena 순위는 Max/High 설정별로 다르고, 태스크당 비용·지연시간 편차도 큼 → 단일 점수만 보고 모델 고르지 말 것
  • DeepSWE·AutomationBench 점수 차이(예: Sol +6.4, Sonnet +2.2)는 특정 태스크·프롬프트 조합에 한정된 수치일 수 있음

다음 주 체크포인트 (TODO)

위 항목을 금주 내에 점검하면, 다음 주 새로운 모델·툴 발표가 있어도 ‘검증된 정보만으로’ 도입 여부를 빠르게 판단할 수 있습니다.


이런 글도 있어요