무마찰 추론
마찰없는추론
핵심 매개변수 및 통계
| 프로젝트 | 사양 |
|---|---|
| 제품명 | 무마찰 추론 |
| 카테고리 | AI 모델 훈련/추론 배포 |
| 배송형태 | SaaS 웹/API |
| 지원되는 플랫폼 | 웹, API, 데스크탑 |
| 지원되는 언어 | ko-KR |
| 대상 사용자 | AI 애플리케이션 개발자, ML 엔지니어, SaaS 제품팀 |
| 사용자 규모 | 50,000명 이상의 등록 개발자, 10,000명 이상의 월별 활성 배포 모델 |
| 가격 모델 | 무료 할당량 + 종량제/구독 |
플랫폼 적용 범위 및 사용자 규모 데이터는 공식 실시간 페이지 및 타사 통계를 기반으로 합니다.
사용자 및 시장 인지도
플랫폼에는 50,000명 이상의 등록 개발자가 있으며, 매월 적극적으로 배포되는 모델의 수는 10,000개를 초과합니다. Product Hunt, Hacker News 등과 같은 커뮤니티에서 긍정적인 평가를 받으세요. 서비스에는 AI 스타트업, 중간 규모 SaaS 팀, Fortune 500대 기업 고객이 포함됩니다. 서버리스 추론 분야에서는 Replicate, Banana Dev, Baseten 등의 플랫폼과 차별화된 경쟁을 형성하며, Hugging Face 모델 호환성 및 맞춤형 컨테이너 지원에 있어 더 큰 장점을 가지고 있습니다.
비용 이점
| 비용 차원 | 설명 |
|---|---|
| 무료 버전 | 월 $0 + $50 무료 통화 크레딧 |
| 프로 | $99/월, 캐시 가속 및 5개의 동시 엔드포인트 포함 |
| 팀 에디션 | $499/월, A/B 테스트 및 API 키 관리 포함 |
| 엔터프라이즈 에디션 | 맞춤형 견적, SLA 99.9%, 다중 지역 재해 복구 |
기존 자체 구축 GPU 클러스터와 비교하여 토큰/초 청구 모델은 트래픽 변동 시나리오에서 총 비용의 40%~70%를 절약할 수 있습니다. GPU는 초당 요금이 청구되며 0으로 축소한 후에는 요금이 청구되지 않습니다.
주요 기능
- 원클릭 모델 배포: Hugging Face 모델 ID 또는 사용자 지정 Docker 이미지에서 직접 추론 엔드포인트를 생성하고 추론 코드를 직접 작성할 필요 없이 모델 로드, 환경 구성 및 포트 매핑을 자동으로 완료합니다.
- 탄력적 자동 확장: 요청 대기열 깊이 및 GPU 사용률을 기반으로 하는 지능적인 전략으로, 트래픽이 가장 적을 때 인스턴스가 0개로 자동으로 축소되고, 피크 시간에 자동으로 확장됩니다.
- 스마트 캐싱: 다단계 캐싱 전략(응답 캐시 + KV 캐시 공유), 반복 요청 적중률 60%~80%, 대기 시간 및 비용 대폭 감소.
- A/B 테스트 및 그레이스케일 출시: 트래픽을 다양한 모델 버전에 비례적으로 라우팅하여 점진적인 출시 및 모델 품질 비교를 지원합니다.
- 모니터링 및 경고: 내장된 Prometheus 호환 지표 및 Grafana 대시보드, 지연 시간, 처리량, 오류율 등과 같은 핵심 지표에 대한 실시간 모니터링.
- 다중 모델 로드 밸런싱: 단일 엔드포인트 뒤에 여러 모델 인스턴스를 탑재하고 가중치 또는 최저 대기 시간 정책을 기반으로 요청을 분산합니다.
모델 및 버전의 진화
| 버전 | 날짜 | 주요 변경 사항 |
|---|---|---|
| v2.5 | 2026-06 | 다중 모델 로드 밸런싱, 사용자 정의 추론 컨테이너, 향상된 캐시, 사용량 대시보드 |
| v2.4 | 2026-04 | A/B 테스트 라우팅, 자동 확장 및 축소 정책 구성, Prometheus 통합 |
| v2.3 | 2026-02 | 다중 지역 배포, 모델 버전 롤백, SSE 스트리밍 출력 |
| v2.0 | 2025-09 | 종합 콘솔 재구성, 팀 협업 공간, API 키 관리 |
| v1.0 | 2025-03 | 첫 번째 공개 버전, 기본 추론 엔드포인트 및 청구 기능 |
기술적인 장점
- 제로 구성 추론 엔진: 모델 아키텍처(LLM, CV, Embedding 등)를 자동으로 식별하고 최적의 추론 프레임워크(vLLM, TGI, Triton 등)를 선택합니다.
- 동적 일괄 처리 및 연속 일괄 처리: 허용된 GPU 메모리 범위 내에서 요청을 일괄 실행으로 자동 병합합니다. LLM 시나리오에서는 연속 일괄 처리를 사용하여 처리량을 3~5배 늘립니다.
- KV 캐시 공유 및 최적화: KV 캐시는 접두사가 동일한 요청에 대해 자동으로 공유되어 RAG 및 대화 시나리오에서 반복 계산을 50% 이상 줄입니다.
- 지능형 콜드 스타트 예열: 인기 모델 스냅샷을 사전 로드하여 콜드 스타트 시간을 분에서 초로 단축합니다.
- 다중 지역 장애 조치: 배포는 여러 가용성 영역에 자동으로 배포되며 엔터프라이즈 버전은 클라우드 간 공급업체 재해 복구를 지원합니다.
사용방법
| 입구 | 사용 방법 |
|---|---|
| 웹 콘솔 | 추론 엔드포인트를 시각적으로 생성 및 관리 |
| REST API | 완전한 플랫폼 API, 프로그래밍 가능한 관리 |
| SDK(Python/Node.js) | 애플리케이션 코드 내에 통합된 언어 기반 SDK |
| CLI 도구 | 명령줄 관리 도구, DevOps 워크플로 |
빠르게 시작하기: 등록 → 엔드포인트 생성 → Hugging Face 모델 ID 입력 → GPU 유형 선택 → 배포 완료(1~5분) → 엔드포인트 URL 및 API 키 가져오기 → 호출 시작.
제품 가격
| 패키지 | 가격 | 목차 |
|---|---|---|
| 무료 버전 | 월 $0 + $50 무료 크레딧 | 기본 추론 엔드포인트, 커뮤니티 지원 |
| 프로 | $99/월 | 캐시 가속, 5개의 동시 엔드포인트, 이메일 지원 |
| 팀 에디션 | $499/월 | A/B 테스트, API Key 관리, 티켓 지원 |
| 엔터프라이즈 에디션 | 맞춤형 견적 | 다중 지역 재해 복구, SLA 99.9%, 전담 계정 관리자 |
GPU 컴퓨팅 요금은 초 단위로 청구되며 A10G의 경우 시간당 약 $0.60, H100의 경우 시간당 약 $3.50입니다. 인스턴스의 활성 시간만 계산됩니다.
애플리케이션 시나리오
- LLM 채팅 API 호스팅: OpenAI API 형식의 추론 엔드포인트로 오픈소스 대형 모델을 배포하고 자동 확장 및 축소를 사용하여 트래픽 변동에 대처합니다.
- 임베딩 및 RAG 파이프라인: 임베딩 모델을 배포하고 벡터 데이터베이스를 사용하여 RAG 지식 기반 질문 및 답변 시스템을 구축하고 응답 캐시를 통해 중복 텍스트 처리 비용을 크게 줄입니다.
- 컴퓨터 비전 추론: 전자상거래 이미지 검토 및 문서 디지털화와 같은 시나리오에 맞게 이미지 분류, 대상 감지, OCR 등의 모델을 배포합니다.
- SaaS 제품 AI 기능 내장 : API Key 및 사용량 관리 시스템을 통해 AI 추론 기능을 SaaS 부가 기능으로 내장하고 사용량에 따라 계정을 구분합니다.
해당자
- 개인 사용자: AI 애플리케이션 개발자는 MLOps를 배우지 않고도 모델 API를 배포할 수 있으며, 무료 할당량은 MVP 프로토타입 검증을 지원합니다.
- SME 팀: ML 엔지니어는 GPU 클러스터를 운영하고 유지 관리할 필요 없이 모델 버전을 빠르게 반복합니다.
- 대기업: 기업 AI 부서의 통합 추론 플랫폼은 여러 모델과 여러 팀의 사용을 관리합니다.
- 부적합한 경계: 완전히 지역화된 배포가 필요하고 외부 API 호출을 허용할 수 없는 엄격한 규정 준수 시나리오입니다. 추론 배포 단계가 아닌 모델 훈련 단계입니다.
경쟁제품 비교
| 비교 차원 | 무마찰 추론 | 복제 | 바스텐 |
|---|---|---|---|
| 핵심 차이점 | Hugging Face 호환 + 맞춤형 컨테이너 | 풍부한 커뮤니티 생태 | 엔터프라이즈급 기능 |
| 가격 | $0 + $50 무료 할당량 | 종량제 | 종량제 |
| 해당 시나리오 | 추론 배포의 전체 시나리오 | 모델 표시 및 호출 | 기업 추론 |
| 사용자 리뷰 | 낮은 진입 장벽 | 많은 모델 | 비즈니스 친화적 |
| 기술적 한계점 | 낮음 | 낮음 | 중간 |
요약 및 전망
Frictionless Inference는 모델 추론 배포 시 마찰을 제거하여 AI 개발자가 최소한의 노력으로 모델을 프로덕션에 투입할 수 있도록 해줍니다. GPU 서버리스 아키텍처, 원클릭 배포 경험 및 풍부한 엔터프라이즈급 기능이 명확한 포지셔닝을 형성합니다.
조달/채택 위험 평가: GPU 유형 선택은 플랫폼이 위치한 클라우드 공급업체에 의해 제한됩니다. 초저 지연 시나리오(<10ms)는 자체 구축 솔루션만큼 안정적이지 않습니다. 엣지/디바이스 측 추론 솔루션, 다중 모드 모델 추론의 심층 최적화, 더 많은 클라우드 네이티브 생태계와의 통합이 출시될지 확인하려면 후속 조치를 취하세요.
| 매개변수 항목 | 자세한 설명 |
|---|---|
| 제품 유형 | GPU 서버리스 모델 추론 플랫폼 |
| 지원 모델 소스 | Hugging Face, 사용자 정의 Docker 이미지, 개인 모델 창고 |
| 지원되는 프레임워크 | PyTorch, TensorFlow, ONNX, vLLM, TGI, 트리톤 |
| GPU 유형 | NVIDIA A100 / H100 / L40S / A10G 등 |
| 자동 스케일링 | 지원(구성 가능한 최소/최대 인스턴스 수) |
| 응답 모드 | REST API/gRPC/SSE 스트리밍 출력 |
| 캐싱 메커니즘 | 응답 캐시 + KV 캐시 최적화 |
| 모니터링 통합 | 프로메테우스 + Grafana 대시보드 |
| SLA | 99.9%(엔터프라이즈판) |
| 배포 지역 | AWS/GCP/Azure 다중 지역 |
| 지원팀 규모 | 개인 개발자부터 기업 팀까지 |
Frictionless Inference는 모델 추론 배포의 핵심 문제점인 인프라 복잡성을 해결하는 것을 목표로 합니다. 플랫폼 통계에 따르면 평균 사용자 모델 출시 시간이 기존 3~5일에서 30분 미만으로 단축되었습니다.
사용자 및 시장 인지도
개발자 커뮤니티: 플랫폼에는 50,000명 이상의 등록 개발자가 있으며 월간 활성 배포 모델의 수는 10,000개를 초과합니다. Product Hunt, Hacker News 등과 같은 커뮤니티에서 긍정적인 평가를 받으세요.
기업 고객: AI 스타트업, 중간 규모 SaaS 팀, Fortune 500 기업 고객을 대상으로 하는 서비스입니다. 일반적인 고객으로는 AI 콘텐츠 생성 플랫폼, 지능형 고객 서비스 SaaS, 컴퓨터 비전 검사 서비스 제공업체 등이 있습니다.
업계 벤치마킹: 서버리스 추론 분야에서는 Replicate, Banana Dev, Baseten 등의 플랫폼과 차별화된 경쟁을 형성합니다. 무마찰 추론은 Hugging Face 모델 호환성 및 사용자 정의 컨테이너 지원에서 더 많은 이점을 제공합니다.
비용 이점
기존의 자체 구축 추론 아키텍처와 비교하여 Frictionless Inference는 비용과 효율성 측면에서 상당한 이점을 제공합니다.
| 비용 항목 | 무마찰 추론 | 자체 구축 GPU 클러스터 | 기존 호스팅 플랫폼 |
|---|---|---|---|
| 초기 투자 | 선불금 없음, 통화량에 따라 결제 | $10,000+(GPU 서버 구매) | $0~$500/월 가입비 |
| GPU 활용도 | 탄력적 공유, 유휴 인스턴스 자동 재활용 | 피크 예약으로 인해 많은 낭비가 발생함 | 플랫폼 스케줄링 효율성에 따라 다름 |
| 확장 및 축소 비용 | 자동 탄력성, 종량제 | 수동 확장이 느리고 리소스를 낭비함 | 일부 플랫폼은 확장 및 축소 속도를 제한합니다 |
| 운영 및 유지관리 인력 | 제로 운영 및 유지 관리 | 1~2개의 SRE/MLOps 필요 | 운영 및 유지관리 업무 일부 양도 가능 |
| 무료 크레딧 | $50 무료 월간 크레딧 | 없음 | 일반적으로 제한됨 |
Frictionless Inference의 토큰/초 청구 모델은 트래픽 변동 시나리오에서 고정 GPU 예약에 비해 총 비용의 40%~70%를 절약합니다.
주요 기능
- 원클릭 모델 배포: Hugging Face 모델 ID 또는 사용자 지정 Docker 이미지에서 직접 추론 엔드포인트를 생성하여 수동으로 추론 코드를 작성할 필요 없이 모델 로드, 컨텍스트 구성 및 포트 매핑을 자동으로 완료합니다.
- 탄력적 자동 확장 및 축소: 요청 대기열 깊이와 GPU 활용도를 기반으로 한 지능적인 확장 및 축소 전략입니다. 트래픽 피크가 낮을 때는 자동으로 인스턴스가 0개로 줄어들고 피크 시간에는 자동으로 확장되어 리소스와 비용 간의 정확한 균형을 유지합니다.
- 스마트 캐싱: 반복 요청에 대한 적중률이 60%~80%인 다단계 캐싱 전략(응답 캐시 + KV 캐시 공유)으로 추론 지연 시간과 API 호출 비용이 크게 줄어듭니다.
- A/B 테스트 및 그레이스케일 출시: 트래픽을 다양한 모델 버전으로 비례적으로 라우팅하여 모델 품질 비교와 점진적인 출시를 촉진하고 새 모델 출시의 위험을 줄입니다.
- 모니터링 및 경보: 내장된 Prometheus 호환 표시기 및 Grafana 대시보드, 대기 시간 P50/P95/P99, 처리량, 오류율, GPU 사용률 등과 같은 핵심 표시기를 실시간 모니터링하고 웹후크 경보를 지원합니다.
- 다중 모델 로드 밸런싱: 단일 엔드포인트에 여러 모델 인스턴스를 탑재할 수 있으며, 전체 처리량 안정성을 향상시키기 위해 가중치 또는 최소 지연 전략에 따라 요청이 할당됩니다.
- API 키 및 사용 관리: 세분화된 API 키 권한 제어 및 사용 할당량 제한, 프로젝트/팀별 계정 분할을 지원하고 SaaS 제품에 내장된 추론 기능에 적합합니다.
- 스트리밍 출력(SSE): 실시간 채팅, 텍스트 생성 및 토큰별 출력이 필요한 기타 시나리오에 적합한 서버 전송 이벤트 스트리밍 응답을 지원하고 OpenAI API 형식과 호환됩니다.
모델 및 버전의 진화
| 버전 | 출시일 | 주요 변경 사항 |
|---|---|---|
| v2.5 | 2026-06 | 다중 모델 로드 밸런싱, 사용자 정의 추론 컨테이너, 향상된 캐시, 사용량 대시보드 |
| v2.4 | 2026-04 | A/B 테스트 라우팅, 자동 확장 및 축소 정책 구성 Prometheus 통합 |
| v2.3 | 2026-02 | 다중 지역 배포, 모델 버전 롤백 SSE 스트리밍 출력 |
| v2.2 | 2025-11 | 사용자 정의 Docker 이미지 지원, 개인 모델 창고 도킹 |
| v2.0 | 2025-09 | 콘솔 종합 재구성, 팀 협업 공간 API 키 관리 및 할당량 |
| v1.5 | 2025-06 | 허깅페이스 원클릭 배포, 자동 확장 및 축소(베타) |
| v1.0 | 2025-03 | 첫 번째 공개 버전, 기본 추론 엔드포인트 및 청구 기능 |
플랫폼은 6~8주마다 한 가지 기능 버전의 중간 속도 반복 리듬을 유지하며 핫픽스 패치 버전도 제공합니다.
기술적인 장점
- 제로 구성 추론 엔진: 사용자가 수동으로 지정할 필요 없이 모델 아키텍처(LLM, CV, Embedding 등)를 자동으로 식별하고 최적의 추론 프레임워크(vLLM, TGI, Triton 등)를 선택합니다.
- 동적 일괄 처리 및 연속 일괄 처리: 허용된 GPU 메모리 범위 내에서 요청을 일괄 실행으로 자동 병합하여 처리량을 크게 향상시킵니다. LLM 시나리오에 연속 일괄 처리 기술을 사용하면 처리량을 최대 3~5배까지 늘릴 수 있습니다.
- KV 캐시 공유 및 최적화: KV 캐시는 접두사가 동일한 요청에 대해 자동으로 공유되어 RAG 및 대화 시나리오에서 반복 계산을 50% 이상 줄입니다.
- 지능형 콜드 스타트 워밍: 인기 모델 스냅샷을 미리 로드하여 콜드 스타트 시간을 분에서 초로 압축하는 동시에 Keep-warm 최소 인스턴스 구성을 지원합니다.
- 다중 지역 장애 조치: 배포가 여러 가용성 영역에 자동으로 배포됩니다. 단일 지역에 장애가 발생하면 자동으로 정상 지역으로 전환됩니다. 엔터프라이즈 버전은 클라우드 공급업체 간 재해 복구를 지원합니다.
사용방법
| 접근방법 | 설명 | 적용 가능한 시나리오 |
|---|---|---|
| 웹 콘솔 | 추론 엔드포인트를 시각적으로 생성 및 관리 | 신속한 프로토타입 검증 |
| REST API | 완전한 플랫폼 API, 프로그래밍 가능한 관리 | CI/CD 통합/자동화 |
| SDK(Python/Node.js) | 언어 기반 SDK | 애플리케이션 코드 내 통합 |
| CLI 도구 | 명령줄 관리 도구 | DevOps 워크플로 |
빠른 시작 단계:
- 계정을 등록하고 웹 콘솔에 로그인하세요.
- "끝점 생성"을 클릭하고 포옹 얼굴 모델 ID(예:
mistralai/Mistral-7B-v0.1)를 입력합니다. - GPU 유형 및 확장 전략 선택(초보자는 기본 구성을 사용할 수 있음)
- 배포가 완료될 때까지 기다립니다(보통 1~5분).
- 엔드포인트 URL과 API 키를 획득하고 호출을 시작하세요.
- 모니터링 대시보드에서 사용량 및 대기 시간 표시기를 봅니다.
제품 가격
| 패키지 | 가격 | 적용규모 | 주요 기능 |
|---|---|---|---|
| 무료 버전 | 월 $0 + $50 무료 크레딧 | 개인 실험 | 기본 추론 엔드포인트, 커뮤니티 지원 |
| 전문가용 버전 | $99/월 | 개인 개발자 | 캐시 가속 5개의 동시 엔드포인트, 이메일 지원 |
| 팀 에디션 | $499/월 | 소규모 팀 | A/B 테스트 API 키 관리, 작업 주문 지원 |
| 엔터프라이즈 버전 | 맞춤형 견적 | 대규모 배포 | 다중 지역 재해 복구 SLA 99.9%, 전담 계정 관리자 |
GPU 컴퓨팅은 초 단위로 비용이 청구되며, GPU 유형에 따라 단가가 다릅니다. A10G는 시간당 약 $0.60, H100은 시간당 약 $3.50입니다. 인스턴스의 활성 시간만 계산되며, 0으로 축소한 후에는 요금이 청구되지 않습니다.
애플리케이션 시나리오
- LLM 채팅 API 호스팅: 챗봇 AI 도우미와 같은 대화형 제품을 구축하는 데 사용되는 OpenAI API 형식의 추론 엔드포인트로 오픈 소스 대형 모델(예: Llama, Mistral, Qwen)을 배포하고 자동 확장 및 축소를 사용하여 트래픽 변동에 대처합니다.
- 임베딩 및 RAG 파이프라인: 임베딩 모델을 처리량이 높은 API로 배포하고 이를 벡터 데이터베이스와 함께 사용하여 RAG 지식 기반 질문 및 답변 시스템을 구축합니다. 응답 캐싱을 사용하면 중복 텍스트 처리 비용을 크게 줄일 수 있습니다.
- 컴퓨터 비전 추론: 이미지 분류 및 대상 감지 OCR과 같은 CV 모델을 배포하고 배치 이미지 URL 입력 및 Base64 인코딩을 지원하며 전자 상거래 이미지 검토 및 문서 디지털화와 같은 시나리오에 적응합니다.
- 모델 품질 평가 및 반복: 온라인 비교를 위한 A/B 테스트를 통해 여러 모델 버전을 동시에 배포하고, 실제 사용자 트래픽을 기반으로 대기 시간 및 품질 지표를 수집하여 모델 선택 및 반복 결정을 지원합니다.
- SaaS 제품에 AI 기능 내장: API Key 및 사용량 관리 시스템을 통해 AI 추론 기능을 SaaS 제품의 부가가치 기능으로 내장하고 사용량에 따라 계정을 여러 고객에게 배포합니다.
해당자
| 군중 | 적응 가치 | 전제조건 |
|---|---|---|
| AI 애플리케이션 개발자 | MLOps를 학습하지 않고 모델 API 배포 | 포옹 얼굴 모델에 대해 알아보기 |
| 머신러닝 엔지니어 | GPU 클러스터를 작동하지 않고 모델 버전을 빠르게 반복 | 모델 추론 프로세스에 익숙함 |
| SaaS 제품팀 | AI 기능을 제품에 내장하고 종량제 결제를 통해 비용 절감 | API 통합 기능 |
| 독립 개발자/기업가 | 무료 할당량은 MVP 프로토타입 검증을 지원합니다 | 기본 API 사용 경험 |
| 엔터프라이즈 AI 부서 | 다중 모델 및 다중 팀 사용을 위한 통합 추론 플랫폼 거버넌스 | 표준화된 AI 서비스 인프라가 필요합니다 |
대중에게 적합하지 않음: 완전히 현지화된 배포가 필요하고 외부 API 호출을 허용할 수 없는 엄격한 규정 준수 요구 사항이 있는 시나리오. 추론 배포 단계가 아닌 모델 훈련 단계의 연구팀.
요약 및 전망
Frictionless Inference는 모델 추론 배포 시 마찰을 제거하여 AI 개발자가 최소한의 노력으로 모델을 프로덕션에 투입할 수 있도록 해줍니다. GPU 서버리스 아키텍처, 원클릭 배포 경험 및 풍부한 엔터프라이즈급 기능은 추론 배포 시장에서 확실한 입지를 형성했습니다.
핵심 장점: 매우 낮은 진입 장벽, 높은 유연성 및 비용 효율성, 엔터프라이즈 수준의 A/B 테스트 및 모니터링, 광범위한 모델 및 프레임워크 호환성.
현재 제한 사항: GPU 유형 선택은 플랫폼이 위치한 클라우드 공급업체에 의해 제한되며, 대기 시간이 매우 짧은 시나리오(10ms 미만)는 자체 구축 솔루션만큼 안정적이지 않으며, 사용자 지정 추론 논리는 순수 자체 구축 솔루션만큼 유연하지 않습니다.
후속 관찰 포인트: 엣지/디바이스 측 추론 솔루션 출시 여부, 다중 모드 모델 추론의 심층 최적화, 더 많은 클라우드 기반 생태계(Kubernetes 등)와의 통합, 모델 미세 조정 기능 향상 여부.
관련 도구: hugging-face, replicate
버전 정보
- 무마찰 추론 v2.5 :다중 모델 로드 밸런싱, 사용자 정의 추론 컨테이너 지원, 향상된 캐싱 전략 및 사용량 분석 대시보드가 추가되었습니다.
- 무마찰 추론 v2.4 :A/B 테스트 라우팅, 자동 확장 및 축소 정책 구성, Prometheus 모니터링 통합을 도입합니다.
- 무마찰 추론 v2.3 :다중 지역 배포, 모델 버전 롤백 및 SSE(응답 스트리밍 출력)를 지원합니다.
- 무마찰 추론 v2.0 :콘솔 UI의 종합적인 재구성, 팀 협업 공간 도입, API 키 관리 및 사용 할당량 제어.
사용자 후기