주요 포인트
- 기존 SDK와의 완전한 호환성을 보장하고 통합을 단순화하려면 /v1/chat/completions 엔드포인트를 사용하세요.
- 조기 잘림 또는 예상치 못한 비용을 피하려면 100k 토큰 컨텍스트 창을 엄격하게 모니터링하세요.
- 속도 제한(RPM)과 무검열 상태의 지연 시간 변동을 처리할 수 있는 견고한 오류 처리를 구현하세요.
- 필요시 하류 모더레이션의 책임은 귀하에게 있음을 명심하세요. 필터 부재는 콘텐츠 필터링이 없다는 의미입니다.
모델 정의
모델 선택은 애플리케이션의 동작을 결정합니다. 검열 없는 AI 사용에는 성인 또는 논쟁적인 주제에서 거절률을 최소화하도록 훈련된 오픈 웨이트 모델을 선택하세요. 일반적인 독점 모델과 달리 이러한 LLM은 기업 정책 기반의 강력한 가드레일을 적용하지 않아 사용자의 프롬프트에 더 충실한 답변을 제공합니다.
모델이 함수 호출(tool calling)을 네이티브로 지원하는지 확인하세요. 이는 JSON 출력을 구조화하거나 외부 API와 상호 작용해야 하는 애플리케이션에 중요합니다. OpenAI API 페이로드 형식과의 호환성은 통합 레이어를 다시 작성하지 않고 공급업체 간 마이그레이션을 가능하게 합니다.
컨텍스트 확인
100,000개의 토큰 컨텍스트 창은 정보 손실 없이 긴 대화나 긴 문서 처리를 가능하게 합니다. 그러나 컨텍스트가 크다고 해서 지능이 높은 것은 아니며, 이는 확장된 메모리만을 의미합니다. 개발자는 대화 기록의 성장을 관리하기 위해 슬라이딩 윈도우 또는 요약 전략을 구현해야 합니다.
- Input Tokens: 대화 기록과 현재 프롬프트를 모두 포함하여 계산됩니다.
- Output Tokens: 생성된 응답을 기준으로 계산됩니다.
토큰 사용량을 실시간으로 모니터링하세요. 100k 제한을 초과하면 서버 구현에 따라 API 오류 또는 잘림이 발생합니다. 긴 채팅 애플리케이션의 경우 비용 예측 가능성을 유지하기 위해 마지막 N회 상호작용만 전송하는 것을 고려하세요.
토큰 관리
무검열 AI의 비용은 처리된 토큰 양에 비례합니다. 모델은 입력 토큰당 백만 개당 $0,25, 출력 토큰당 백만 개당 $1,00을 청구합니다. 필터 없는 모델에서는 출력이 일반적으로 더 길고 복잡하므로 출력 비용이 입력 비용을 크게 초과할 수 있습니다.
요청 전송 전 클라이언트 측에서 토큰 카운터를 구현하세요. 이렇게 하면 전송 전 응답의 정확한 비용을 추정할 수 있습니다. 최적화를 위해 시스템 프롬프트의 verbosity를 줄이고 가능한 한 자연어 대신 함수를 사용하여 구조화된 데이터를 반환하세요. JSON은 자연어보다 토큰 밀도가 높기 때문입니다.
요청 제한
안정성을 보장하기 위해 서비스는 API 키당 분당 300개 요청(RPM) 제한과 최대 8 MB의 요청 본문을 부과합니다. 사용량 급증 시 RPM을 초과하면 429 오류(Too Many Requests)가 발생합니다. 개발자는 지수 백오프 재시도 로직을 구현해야 합니다.
높은 동시성을 가진 애플리케이션에서 수요를 완화하기 위해 메시지 큐 사용을 고려하세요. 더 높은 처리량이 필요한 경우 여러 API 키에 부하를 분산하거나 인프라의 자연스러운 제한을 준수하기 위해 사용자의 지각된 지연 시간을 늘리세요.
API 키 보안
API 키는 무검열 AI에 대한 유일한 접근 자격 증명입니다. 키는 자동으로 만료되지 않지만 언제든지 무효화할 수 있습니다. 키를 서버의 환경 변수에 보관하고 프론트엔드 코드나 공개 저장소에 노출하지 마세요.
부정 사용 의심 시 즉시 새 키를 생성하세요. 이렇게 하면 기존 키가 무효화되고 해당 키를 사용하는 모든 클라이언트의 접근이 차단됩니다. 플랫폼에서 상세 모니터링을 허용하는 경우 봇이나 유출된 스크립트를 빠르게 감지하기 위해 과사용 알림을 활성화하세요.
오류 처리
흔한 오류에는 429 Too Many Requests(속도 제한), 400 Bad Request(잘못된 형식), 500 Internal Server Error가 있습니다. 네트워크 오류와 타임아웃을 항상 처리하세요. 무검열 모델은 학습 데이터의 선별 과정이 적어 가끔 불완전한 응답을 반환하거나 환각 현상이 더 자주 발생할 수 있습니다.
폴백 로직을 구현하세요. 응답이 실패하면 약간 다른 temperature로 다시 시도하거나 컨텍스트 크기를 줄이세요. 최종 사용자에게 원시 기술 오류를 표시하면 혼란스러울 수 있으므로, 항상 오류 코드를 이해하기 쉽고 실행 가능한 메시지로 변환하세요.
스트리밍 및 실시간
서버 전송 이벤트(SSE) 스트리밍 지원은 토큰 단위로 응답을 표시하여 사용자의 지연 시간 인식을 개선합니다. 이는 실시간 채팅 애플리케이션에 필수적입니다.
스트리밍을 구현하려면 HTTP 클라이언트를 데이터 청크가 도착할 때마다 읽도록 구성하세요. 이렇게 하면 인지된 초기 대기 시간(TTFT)이 줄어듭니다. 연결이 끊겨 재연결해야 할 경우 토큰 중복을 피하기 위해 클라이언트 상태를 관리하는 것을 잊지 마세요. 스트리밍은 부과되는 가격에는 영향을 주지 않으며, 데이터가 전달되는 방식만 변경합니다.
함수 사용
함수(function calling)를 통해 모델이 외부 도구를 언제 어떻게 호출할지 결정할 수 있습니다. 제한 없는 API를 사용하면 모델이 함수 인수를 구조화하는 데 더 창의적일 수 있습니다. 실행하기 전에 서버 측에서 수신된 매개변수를 검증하세요.
함수에 대한 명확한 JSON 스키마를 정의하세요. 무검열은 JSON의 기술적 정확성에 영향을 주지 않지만 모호한 컨텍스트 해석에 대한 모델의 창의성에 영향을 줄 수 있습니다. 모델이 스키마에 정의되지 않은 인수를 발명할 수 있는 극단적인 사례를 광범위하게 테스트하세요.
데이터 프라이버시
모델이 콘텐츠를 필터링하지 않더라도, 학습용 데이터 사용 정책을 확인하세요. 이 서비스는 프롬프트가 모델 학습에 사용되지 않는다고 명시하며, 이는 기업용 또는 민감한 애플리케이션에 중요합니다. 프라이버시는 서비스의 단순성으로 보장됩니다: 계정 생성에 이메일과 비밀번호만 필요하기 때문입니다.
매우 민감한 데이터의 경우 프라이버시가 중요할 때 API로 전송하기 전에 데이터 오푸스커이션 레이어를 구현하는 것을 고려하십시오. 모델은 전송된 프롬프트를 기반으로 텍스트를 생성합니다. 따라서 이름을 전송하면 응답에 나타날 수 있습니다. 무검열 모델은 PID(개인 식별 정보)를 자동으로 차단하지 않습니다.