
Jay.TechLog
소프트웨어 엔지니어와 아키텍트를 위한 System One 모델 입문
GPT와 Jev가 함께 다이아몬드 도난 사건을 해결한다고 상상해보자. GPT는 흩어진 단서의 의미와 범인의 의도를 해석한다. Jev는 여러 단서를 빠르게 확인하고, 지금 어느 경로를 추적할지 확률로 판정한다.
이 비유는 두 모델의 차이를 잘 보여준다. GPT 같은 대규모 언어 모델은 사람이 읽을 문장과 코드를 생성하는 데 강하다. Jev는 소프트웨어가 바로 사용할 수 있는 타입이 정해진 확률적 결정을 반환하는 데 초점을 맞춘다.
LLM과 무엇이 다른가?
기존 LLM을 업무 시스템에 연결하면 모델이 생성한 문자열이나 JSON을 파싱하고, 스키마를 검증하고, 실패 시 재요청하는 코드가 필요하다. 사람과 대화할 때 문자열의 유연성은 장점이지만, 자동화 파이프라인에서는 출력 변화와 예상하지 못한 값이 운영 리스크가 된다.
TypeSafe는 이 문제를 해결하기 위해 Jev를 첫 번째 System One 모델로 공개했다. 공식 문서의 개념을 한 문장으로 줄이면 다음과 같다.
비정형 상태를 입력하고, 코드가 바로 사용할 수 있는 타입화된 확률 결정을 받는다.
Jev는 state와 타입이 지정된 questions를 입력받아 구조화된 답을 반환한다. 문장을 생성한 뒤 다시 파싱하는 과정이 없으며, 여러 질문을 같은 상태에 대해 병렬로 평가한다. TypeSafe 소개 문서
세 가지 판단 프리미티브
Jev의 공식 API는 세 종류의 질문을 제공한다.
Noul: 참일 가능성
특정 문장이 참일 가능성을 0과 1 사이의 값으로 반환한다. 일반 사용자용 화면에서는 Yes/No 확률로 이해할 수 있다. “이 문의는 긴급한가?”, “보안 사고 가능성이 있는가?”처럼 좁고 명확한 질문에 적합하다.
Choice: 선택지 분류
미리 정의한 선택지 중 하나를 고르고 전체 확률 분포와 신뢰도를 반환한다. 고객 문의를 billing, technical, sales로 분류하거나 문서를 approve, review, reject로 라우팅할 수 있다.
Score: 수준 평가
사용자가 정의한 단계에 따라 입력을 평가한다. 고객 불만 수준이나 보안 위험도를 여러 단계로 나누는 경우가 대표적이다.
Choice와 Score가 반환하는 confidence는 시스템 행동을 통제하는 두 번째 축이 된다. 높은 신뢰도에서는 자동 실행하고, 중간이면 추가 확인, 낮으면 사람이나 다른 모델로 보낼 수 있다. Confidence 가이드
API는 어떤 모습일까?
다음은 TypeScript 애플리케이션에서 고객 문의를 분류하는 단순화된 예다.
const response = await fetch("https://api.typesafe.ai/v1/systemone", {
method: "POST",
headers: {
Authorization: `Bearer ${process.env.TYPESAFE_API_KEY}`,
"Content-Type": "application/json",
},
body: JSON.stringify({
model: "jev-latest",
state: customerMessage,
questions: {
department: {
type: "choice",
instructions: "Which team should handle this?",
criteria: {
billing: "Payment or subscription issues",
technical: "Bugs or integration problems",
sales: "Pricing or account questions",
},
},
urgency: {
type: "noul",
instructions: "The message is urgent or time-sensitive",
},
},
}),
});
const result = await response.json();
const answer = result.answers.department;
if (answer.confidence >= 0.9) {
routeAutomatically(answer.choice);
} else {
sendToHumanReview(result);
}
모델이 업무 규칙 전체를 자유롭게 생성하지 않는다는 점이 중요하다. Jev는 좁은 질문을 평가하고, 실제 분기와 권한 통제는 코드가 담당한다. TypeSafe Quick Start
아키텍처에서는 어디에 배치할까?
Jev를 LLM의 대체재보다 결정 계층으로 보는 편이 정확하다.
이벤트·문서·사용자 입력
↓
상태 정규화와 질문 구성
↓
Jev: 분류·점수·확률 판단
↓
Confidence Gate
├─ 높음 → 자동 실행
├─ 중간 → 추가 확인
└─ 낮음 → 사람 또는 LLM 검토
GPT와 결합한다면 역할은 더욱 명확해진다.
- GPT: 요약, 원인 분석, 질문 설계, 예외 설명
- Jev: 반복 분류, 위험 판정, 우선순위 평가, 실시간 라우팅
- 애플리케이션 코드: 임계값, 권한, 감사 로그, 최종 실행 통제
TypeSafe는 여러 질문을 한 번에 보내는 Speculative Fan-Out, 신뢰도에 따라 경로를 나누는 Confidence-Gated Routing, 여러 점수를 코드에서 결합하는 Composite Scoring 등을 대표 패턴으로 제시한다. 아키텍처 패턴
어디에 활용할 수 있을까?
Jev는 새로운 문장을 작성하는 업무보다 같은 기준으로 반복 판단하는 업무에 잘 맞는다.
- 고객 문의의 부서·긴급도·불만 수준 분류
- 로그와 이벤트의 이상 신호 탐지
- 콘텐츠 정책 위반 가능성 평가
- 거래·계정 활동의 위험 점수화
- 문서 검수와 승인 경로 결정
- 에이전트 출력의 안전성 점검
반대로 긴 보고서 작성, 자유로운 대화, 복잡한 원인의 서술형 설명, 여러 단계의 장기 추론에는 GPT 같은 생성 모델이 더 적합하다. 넓은 질문은 시장성, 기술 가능성, 차별성처럼 독립적인 판단으로 분해하고 가중치와 업무 규칙을 코드에서 결합해야 한다.
도입 전 확인할 점
Jev는 아직 초기 접근 단계다. TypeSafe는 높은 속도와 효율을 발표했지만 공급사가 설계한 평가 결과이므로, 실제 업무 데이터로 다시 검증해야 한다. 공식 발표에도 평가 조건과 편향 가능성이 설명되어 있다. TypeSafe Jev 발표
운영 도입 전에는 다음 항목을 확인하는 것이 좋다.
- 실제 데이터로 정확도와 확률 보정 상태 측정
- 업무 위험도별 confidence 임계값 설정
- 낮은 신뢰도의 사람·LLM 검토 경로 마련
- 모델 버전, 입력, 출력, 최종 행동 감사 로그 기록
- 자동 실행 전 오프라인 평가와 섀도 모드 운영
또한 jev-ai.pro는 Jev를 체험할 수 있는 독립 서비스로 TypeSafe 공식 서비스와 구분해야 한다. 실제 시스템에서는 공식 API의 데이터 처리 조건과 장애 대응 방식도 별도로 검토할 필요가 있다.
결론: AI를 확률적 조건문으로 사용하기
GPT가 복잡한 사건의 의미를 해석하고 해결책을 설명하는 분석가라면, Jev는 지금 어떤 경로를 선택할지 확률로 알려주는 판단 요원에 가깝다.
중요한 것은 둘 중 하나를 선택하는 일이 아니다. 생성과 판단을 분리하고 각 모델을 잘하는 위치에 배치하는 것이다.
Jev의 가장 흥미로운 가능성은 AI를 거대한 챗봇으로 사용하는 대신, 기존 코드 안에 삽입할 수 있는 확률적 조건문으로 바꾸는 데 있다. 소프트웨어 엔지니어와 아키텍트가 던져야 할 질문도 명확하다.
우리 시스템에서 사람이 반복하고 있는 판단 중, 어떤 부분을 타입이 있는 확률 함수로 바꿀 수 있는가?
그 질문에 명확한 답이 있다면 Jev는 실험해볼 가치가 있는 새로운 아키텍처 구성요소다.
Jev AI 및 System One 모델 핵심 분석 브리핑
요약 보고서 (Executive Summary)
본 보고서는 TypeSafe의 ‘System One’ 모델인 Jev와 이를 활용할 수 있는 독립적 서비스인 Jev AI에 대한 상세 분석을 담고 있습니다. Jev는 일반적인 텍스트 생성 모델과 달리 빠르고 구조화된 의사결정에 특화된 모델로, 하나의 텍스트에 대해 여러 질문을 병렬로 처리하여 수치화된 확률과 보정된 신뢰도를 제공합니다.
핵심 요점은 다음과 같습니다:
- System One 모델: 텍스트 생성이 아닌, 텍스트 분석을 통한 구조적 판단(Yes/No, 선택, 점수화)에 최적화되어 있습니다.
- 수치적 결과값: 개발자가 코드 분기 처리에 직접 활용할 수 있는 레이블과 숫자 형태의 응답을 반환합니다.
- 병렬 처리: 단 한 번의 API 호출로 여러 개의 세부 질문을 동시에 평가하여 효율성을 극대화합니다.
- 독립적 서비스: Jev AI는 TypeSafe의 공식 API를 호출하는 독립적인 플레이그라운드이자 API 서비스로, TypeSafe와 직접적인 제휴 관계는 없습니다.
1. Jev 모델의 개념 및 특징
Jev는 TypeSafe의 플래그십 모델이자 최초의 System One 모델입니다. 이 모델은 기존의 거대 언어 모델(LLM)이 추구하는 텍스트 생성(Prose)보다는 구조화된 의사결정에 집중하도록 훈련되었습니다.
주요 기능적 특징
- 유형화된 답변 (Typed Answers): 코드에서 즉시 분기 처리(Branching)가 가능하도록 숫자와 레이블 형태의 결과를 제공합니다.
- 보정된 신뢰도 (Calibrated Confidence): 모든 답변에는 해당 결과에 대한 모델의 확신도를 나타내는 확률값이 포함됩니다.
- 병렬 질문 처리 (Parallel Evaluation): 하나의 상태(State)에 대해 정의된 여러 개의 좁은 질문들을 동시에 평가합니다.
- API 호환성: TypeSafe와 호환되는 요청 형식을 유지하여 기존 시스템과의 통합이 용이합니다.
2. Jev AI 서비스 및 질문 유형
Jev AI(jev-ai.pro)는 Jev 모델을 테스트하고 API 형태로 호출할 수 있는 환경을 제공합니다. 사용자는 텍스트 데이터와 함께 질문을 던지고, 모델은 이를 분석하여 확률 기반의 답변을 내놓습니다.
지원하는 질문 유형
Jev AI는 세 가지 주요 판단 방식을 지원합니다.
| 유형 | 설명 | 출력 형식 |
| Yes / No | 특정 질문에 대한 긍정 확률을 판단 | 0~100% 사이의 확률값 |
| Choice (선택) | 제시된 여러 옵션 중 하나를 선택 | 각 옵션별 확률 수치 제공 |
| Score (점수) | 사용자가 정의한 기준에 따라 텍스트를 평가 | 설정된 레벨에 따른 점수 산출 |
3. 기술 사양 및 워크플로우
운영 프로세스
- 사례 선택 (Pick a case): 분석할 텍스트 시나리오 설정
- 질문 편집 (Edit questions): 모델이 판단해야 할 세부 질문 정의
- 실행 (Run Jev AI): 모델 분석 수행 및 결과 확인
- API 배포 (Ship with the API): 확인된 로직을 API를 통해 실제 서비스에 적용
데이터 입력 및 언어 지원
- 입력 형식: 오직 텍스트 데이터만 수용합니다 (문자열, JSON 객체, 또는 배열 형태). 이미지나 PDF는 텍스트로 변환 후 전송해야 합니다.
- 지원 언어: 영어가 주 언어이며 가장 높은 정확도를 보입니다. 다른 언어도 지원되지만 신뢰도가 낮을 수 있으므로, 결과값의 신뢰도 지표를 반드시 모니터링해야 합니다.
4. 비용 구조 및 운영 정책
비용 및 크레딧 시스템
Jev AI는 입력 토큰 수를 기준으로 비용을 산정하며, 크레딧 시스템을 통해 운영됩니다.
- 무료 혜택: 신규 계정 가입 시 5크레딧을 제공하며, 매일 체크인 시 추가 무료 크레딧을 제공합니다.
- 유료 결제: 월간 플랜이나 일회성 팩을 통해 구매 가능합니다.
- 비용 산정: API 호출 또는 플레이그라운드 실행 시 입력 토큰 100만 개당 1크레딧이 차감됩니다.
서비스 면책 사항 및 소유권
- 독립성: Jev AI는 TypeSafe의 공식 API를 호출하여 작동하는 독립 서비스이며, TypeSafe와 제휴하거나 그로부터 보증을 받지 않습니다.
- 확률적 결과: Jev의 답변은 확률적(Probabilistic) 판단에 기초합니다. 따라서 중요한 의사결정을 내리기 전에는 반드시 사람이 결과를 검토해야 합니다.
- 상표권: Jev와 TypeSafe는 해당 소유자의 고유 자산입니다.
5. 결론 및 권장 사항
Jev 모델은 단순한 텍스트 생성을 넘어, 대량의 데이터에서 빠르고 정확한 구조적 판단이 필요한 시스템에 적합합니다. 특히 API 호출 한 번으로 병렬적인 데이터 추출 및 평가가 가능하다는 점은 개발 효율성을 크게 향상시킵니다. 단, 모델의 판단이 확률에 기반하므로 시스템 설계 시 신뢰도 지표를 연동하고, 중요한 결정 단계에서는 인간의 검토 과정을 포함할 것을 권장합니다.