클라우드플레어 Clef: 무료 오픈소스 결정 모델로 AI 에이전트 판단 자동화하기
LLM은 추론은 잘하지만 출력이 비결정적이고 느려 에이전트의 실시간 판단에는 부적합합니다. 클라우드플레어가 공개한 Clef는 2초 내에 구조화된 확률 출력을 내놓아 티켓 라우팅·도메인 분류 같은 판단을 완전 자동화합니다. 이 글은 Clef의 특징부터 로컬 실행·파인튜닝까지 전 과정을 다룹니다.
AI 에이전트에게 '판단'을 맡기려 하면 LLM의 느린 속도와 들쑥날쑥한 출력 때문에 결국 사람이 개입하게 됩니다. 클라우드플레어가 아파치 2.0 라이선스로 공개한 결정 모델 Clef는 이미지·긴 문맥을 받아들여 2초 만에 확률 기반의 정형 출력을 내놓으며, 강화학습 플랫폼으로 직접 파인튜닝까지 가능합니다. 이 가이드에서는 Clef가 왜 필요한지, 어떻게 바로 써먹는지 단계별로 정리합니다.
결정 모델이란 무엇인가 — LLM과 어떻게 다른가
결정 모델은 입력에 대해 제한된 구조화된 출력을 저렴하고 빠르게 일관적으로 제공해 주는 AI 모델입니다. 예를 들어 고객 지원 메시지를 전달하면 ‘긴급 여부’와 ‘처리 팀’ 같은 정보를 확률과 함께 반환합니다. 이 결과는 코드에서 티켓을 라우팅하거나 에스컬레이션을 트리거하거나 필요 시 인간에게 전달하도록 활용할 수 있습니다. 따라서 인간이 항상 개입할 필요가 없으며, 에이전트가 프로그램적으로 판단하고 실행할 수 있습니다.
반면 LLM은 비결정적이며, 열린 문장 생성과 도구 호출을 통해 복잡한 추론을 수행합니다. 하지만 구조화된 결과가 필요할 때는 결정 모델이 더 적합합니다. 클라우드플레어의 Clef는 이미지 입력을 처리할 수 있는 비전 인코더와 64k 컨텍스트 윈도우를 갖추어 32k 컨텍스트 윈도우를 가진 Jev보다 더 많은 정보를 한 번에 분석할 수 있습니다. Clef는 평가에서 리더십을 보였으며, 제시된 예시에서 2.2초만에 도메인 카테고리를 분류했는데, 같은 워크플로우에서 GPT-OSS-120b는 4.7초가 걸리고 두 개의 분류만 반환했습니다.
| 모델 종류 | 특성 | 예시 |
|---|---|---|
| 분류기 | 텍스트만 처리 | 단일 라벨 분류 |
| LLM | 비결정적, 대화형 | 텍스트 생성 및 도구 호출 |
| 결정 모델 | 구조화된 결과, 확률 반환 | 긴급 판단, 팀 할당 등 |
- 이미지와 텍스트 모두 입력 가능 (비전 인코더)
- 64k 컨텍스트 윈도우로 더 많은 정보를 한 번에 처리
- Jev-API와 완전 호환, 실험 및 배포가 용이
- Apache 2.0 라이선스로 로컬에서도 실행 가능
- 강화학습 플랫폼을 통해 사용자 맞춤 파인튜닝이 가능
Clef·Clef-flash 핵심 스펙 한눈에 보기
Cloudflare가 공개한 결정 모델 Clef와 경량 버전 Clef-flash는 모두 Apache 2.0 라이선스로 배포돼 로컬 실행·상업적 이용·수정·재배포가 자유롭습니다. 두 모델은 Jev API와 완전 호환되므로 기존 Jev 클라이언트 코드나 OpenAI 호환 엔드포인트를 그대로 써서 추론할 수 있습니다.
| 구분 | Clef | Clef-flash |
|---|---|---|
| 비전 인코더 | 지원 (이미지 입력 분류 가능) | 지원 (이미지 입력 분류 가능) |
| 컨텍스트 윈도우 | 64k 토큰 | 64k 토큰 |
| 라이선스 | Apache 2.0 | Apache 2.0 |
| Jev API 호환 | 완전 호환 | 완전 호환 |
| 학습 주체 | Cloudflare 자체 학습 | Cloudflare 자체 학습 |
| 주요 용도 | 고정밀 분류·복잡한 의사결정 | 저지연·경량 추론 |
Cloudflare 내부 테스트(위협 인텔리전스 도메인 분류)에서 Clef는 2.2초 만에 페치·렌더·분류를 마쳤으며, 동일 워크플로에서 범용 LLM(gpt-oss-120b)은 4.7초가 걸리고 분류 수도 2개에 그쳤습니다. 이처럼 지연 시간 약 2배 단축·더 풍부한 레이블로 에이전트 워크플로의 자율 의사결정 속도를 크게 높일 수 있습니다.
빠른 시작 포인트
- Hugging Face에서
clef/clef-flash가중치 다운로드 → 로컬llama.cpp·vLLM·Ollama등으로 즉시 서빙 가능 - Jev 공식 SDK(
pip install jev)로client.classify(inputs, model="clef")호출 시 API 키 없이 로컬 엔드포인트 사용 - Apache 2.0이므로 파인튜닝·임베딩·온프레미스 배포 시 법적 제약 없음
실전 예시: 도메인 위협 인텔리전스 2.2초 분류 워크플로
이번 섹션에서는 클라우드플레어가 실제로 도메인 위협 인텔리전스에 Clef를 적용한 사례를 살펴봅니다. 브라우저 렌더링과 함께 2.2초 만에 웹사이트를 분류하고, 결과를 바로 활용하는 워크플로를 보여드립니다.
| 카테고리 | 확률 |
|---|---|
| 패션 | 95% |
| 전자상거래 | 85% |
| 피싱 | <1% |
도메인 입력
분류하고자 하는 도메인을 Clef API에 전달합니다.
브라우저 렌더링
Clef가 브라우저를 실행해 웹페이지를 로드하고 렌더링합니다.
분류 실행
비전 인코더가 화면을 분석해 카테고리를 추정합니다.
결과 활용
확률이 높은 카테고리에 따라 자동 라우팅이나 경보를 트리거합니다.
- 지연 시간 2.2초로 빠른 응답
- 다중 카테고리 반환으로 정보량 확대
- LLM 대비 2배 이상의 속도 향상
- 자동화된 워크플로를 통해 인력 부담 감소
강화학습 파인튜닝 플랫폼으로 내 도메인에 맞게 최적화하기
클라우드플레어는 최근 강화학습(RL) 기반 파인튜닝 플랫폼을 공개하여 고객이 Clef 모델을 자신의 도메인에 맞게 최적화할 수 있도록 지원합니다. 이 플랫폼에서는 사용자가 직접 데이터셋을 업로드하고, 보상 함수를 설정한 뒤, Clef 모델을 파인튜닝하여 최종적으로 배포까지 한 번에 수행할 수 있습니다. RL 플랫폼은 모델이 특정 도메인에서 더 높은 정확도를 달성하도록 학습하도록 설계되어, 기존에 제공되는 사전 학습 모델보다 더 정밀한 판단을 가능하게 합니다.
강화학습 파인튜닝 프로세스는 크게 네 단계로 나뉩니다. 첫 번째 단계에서는 도메인에 특화된 예시 데이터를 클라우드플레어 플랫폼에 업로드합니다. 두 번째 단계에서는 도메인에서 중요한 판단 기준을 수치화한 보상 함수를 정의합니다. 보상 함수는 모델이 특정 입력에 대해 최적의 출력을 내도록 유도합니다. 세 번째 단계에서는 정의된 데이터와 보상 함수를 기반으로 Clef 모델을 파인튜닝합니다. 마지막으로 파인튜닝된 모델을 클라우드에 배포하면, 실시간으로 도메인에 맞는 의사결정을 자동화할 수 있습니다.
데이터셋 업로드수분
도메인별 예시 데이터(텍스트, 이미지 등)를 플랫폼 UI 또는 API를 통해 업로드합니다.
보상 함수 정의수분
정확도, 속도, 비용 등 원하는 지표를 기반으로 보상 값을 설정합니다.
파인튜닝 실행수시간
업로드된 데이터와 보상 함수를 사용해 Clef 모델을 강화학습으로 재학습합니다.
배포 및 모니터링수분
파인튜닝된 모델을 엔드포인트에 배포하고, 성능을 실시간으로 모니터링합니다.
주의할 점·한계·마이그레이션 체크리스트
Clef와 같은 결정 모델은 LLM과 달리 정해진 구조의 결과를 저렴하고 빠르게 제공하도록 설계되었습니다. 하지만 이러한 모델은 개방형 추론(open‑ended reasoning)을 수행할 수 없으며, 입력에 따라 제한된 분류 항목만 반환합니다. 또한 모델이 지원하는 컨텍스트 창은 64k 토큰으로 제한되어 있어, 그보다 긴 문맥을 처리할 때는 입력을 요약하거나 분할해야 합니다. 이러한 제약은 특히 복잡한 의사결정 로직이 필요한 워크플로에서 주의해야 할 포인트입니다.
Clef는 Apache 2.0 라이선스로 배포됩니다. 이 라이선스는 소스 공개와 함께 사용 시 저작권 표시 및 라이선스 문서의 포함을 요구합니다. 따라서 내부에서 모델을 커스터마이즈하거나 재배포할 때는 이 조건을 준수해야 하며, 상업적 활용 시에도 동일한 라이선스 의무가 적용됩니다. 또한 버전이 업그레이드될 때는 모델 성능이 변동될 수 있으므로, 기존 사용 시와 동일한 평가 기준으로 재검증이 필요합니다.
- 결정 모델은 개방형 추론이 불가
- 컨텍스트 창은 64k 토큰으로 제한
- Apache 2.0 라이선스 준수 필요
- 버전 업그레이드 시 재평가 필수