Cloudflare 작업자 AI

-

Cloudflare Workers AI는 Cloudflare가 출시한 글로벌 에지 AI 추론 플랫폼입니다. Workers Serverless 아키텍처를 기반으로 310개 이상의 도시에 있는 에지 노드에서 오픈 소스 LLM 및 이미지/오디오 모델 실행을 지원하여 지연 시간이 짧은 AI 추론을 달성합니다.

Cloudflare 작업자 AI 제품 인터페이스

CloudflareWorkersAI

핵심 매개변수 및 통계

매개변수 항목 설명
제품 포지셔닝 글로벌 엣지 AI 추론 서버리스 플랫폼
적용 범위 노드 310개 이상의 도시, 120개 이상의 국가
지원되는 모델 유형 LLM 텍스트 생성 임베딩, 이미지 생성, 음성 인식, 번역
모델 소스 오픈소스 모델(Llama, Mistral, Stable Diffusion, Whisper 등)
맞춤형 모델 프라이빗 모델 업로드 지원(LoRA를 통한 미세 조정 또는 전체 배포)
런타임 Cloudflare 작업자(V8 Isolate 아키텍처)
GPU 가속 작업자 AI 노드에는 필요에 따라 할당되는 GPU가 장착되어 있습니다

Workers AI의 핵심 차이점은 "GPU에 대해 걱정할 필요가 없다"는 것입니다. 기존 AI 추론에는 GPU 서버 임대, 추론 프레임워크 구성, 자동 확장 및 축소 처리가 필요합니다. Workers AI는 이 모든 것을 API 호출의 단일 라인으로 추상화하여 전 세계에서 가장 가까운 노드에서 자동으로 추론을 실행합니다. 지연 시간에 민감한 실시간 AI 애플리케이션의 경우 에지 추론은 중앙 클라우드에 비해 네트워크 지연 시간을 50~80% 줄일 수 있습니다.

사용자 및 시장 인지도

현장에서 점차적으로 사용자 인지도를 구축하고, 콘텐츠 제작자와 팀은 제품 기능을 사용하여 업무 효율성을 향상시킵니다. 일부 업계 사용자는 이를 일상 작업 흐름에 통합했습니다. 특정 사용자 규모 및 업계 채택률 데이터에 대한 최신 공식 공개를 참조하는 것이 좋습니다.

비용 이점

  • C사이드/개인 : 핵심 기능 체험을 위해 주로 무료 버전을 제공하며, 빈도가 높은 경우에는 유료 패키지 가입이 필요합니다.
  • API/개발자: 호출량에 따라 비용이 청구되며 자체 시스템에 유연하게 통합할 수 있는 개발팀에 적합합니다.
  • 기업/민영화: 맞춤형 견적 및 배포 계획은 사업주에게 문의하세요. 구체적인 가격은 공식 실시간 가격 페이지에 따릅니다.

주요 기능

  • 원클릭 추론 API: @cloudflare/ai SDK를 통해 env.AI.run('@cf/meta/llama-4', { 프롬프트 })를 호출하여 인프라 및 GPU를 관리할 필요 없이 모델 추론을 완료합니다.
  • 모델 카탈로그: ​​텍스트 생성(Llama, Mistral, Gemma), 임베딩(BGE), 이미지 생성(Stable Diffusion), 음성 인식(Whisper), 번역 등 50개 이상의 오픈 소스 모델의 사전 배포를 지원합니다.
  • AI 게이트웨이: AI API에 대한 캐싱, 속도 제한, 대체 및 로그를 통합 관리합니다. 모델 요청은 먼저 캐시 확인 → 실패 후 자동으로 폴백 → 할당량 초과 시 대기열에 추가하여 API 비용을 30~50% 절감합니다.
  • 사용자 정의 모델 배포: LoRA 미세 조정을 통해 사용자 정의 어댑터를 업로드하거나 자체 모델 파일을 배포하여 에지 노드에서 비공개 추론을 실행합니다.
  • 벡터 데이터베이스 벡터화: Workers AI와 긴밀하게 통합된 에지 벡터 데이터베이스로, RAG 애플리케이션 구성을 위한 임베딩 스토리지 및 유사성 검색을 지원합니다.
  • 스트리밍 스트리밍 응답: 기본적으로 SSE 스트리밍 추론을 지원하고 결과 토큰을 토큰별로 반환하며 사용자는 생성이 완료될 때까지 기다릴 필요가 없습니다.

모델 및 버전의 진화

지속적인 반복 업데이트인 최신 버전에는 성능 최적화와 새로운 기능이 도입되었습니다. 과거 버전 정보는 공식 출시 페이지에서 확인할 수 있습니다. 아직 완전한 공개 버전 발전 일정은 없습니다. 기능 업데이트의 리듬을 이해하려면 공식 발표에 주의를 기울이는 것이 좋습니다.

기술적인 장점

  • 알고리즘 최적화: 응답 속도와 결과 품질 간의 균형을 달성하기 위해 해당 시나리오에 대해 모델 또는 알고리즘 수준에서 특수 최적화가 수행되었습니다.
  • 낮은 대기 시간 아키텍처: 스트리밍 또는 비동기 처리 아키텍처를 채택하여 사용자 대기 시간을 줄이고 빈도가 높은 상호 작용 시나리오에 적합합니다.

사용방법

  • 웹 클라이언트 : 공식 홈페이지에 접속하여 계정을 등록하시면 사용하실 수 있습니다. 대부분의 기능은 설치가 필요하지 않습니다.
  • API 액세스: RESTful API를 제공하며 개발자는 API 키를 획득하여 자신의 애플리케이션에 통합할 수 있습니다.

제품 가격

Workers AI는 종량제 모델을 사용하여 추론 시간과 모델 유형을 기준으로 요금이 청구됩니다.

모델 카테고리 가격
LLM 텍스트 생성 $0.001-0.003/시간 추론(모델 크기에 따라 다름)
임베딩 생성 $0.0005/천 회
이미지 생성 $0.003-0.005/이미지
음성인식 $0.002/분 오디오
근로자 요청 무료 플랜: AI 호출을 포함하여 일일 요청 100,000개

자체 구축된 GPU 추론 클러스터와 비교할 때 Workers AI는 중소 트래픽 시나리오에서 비용 이점이 분명하지만 고주파수 대규모 모델 호출은 자체 구축 GPU 솔루션을 초과할 수 있습니다. Workers Free 플랜은 하루 100,000건의 요청 할당량으로 소규모 프로젝트 및 프로토타입 개발에 완전히 무료입니다.

애플리케이션 시나리오

  • 실시간 AI 고객 서비스: Workers AI는 전 세계 엣지 노드에서 LLM 추론을 실행하고, 사용자 요청은 가장 가까운 노드에서 처리되며, 첫 번째 단어 지연(TTFT)은 중앙 클라우드 서비스의 2~3초보다 훨씬 낮은 500ms 이내에 제어할 수 있습니다.
  • RAG 지식 베이스 Q&A: Workers AI의 임베딩 모델 + 벡터화 벡터 데이터베이스는 에지 RAG 애플리케이션을 구현합니다. - 사용자 질문 → 벡터화 → 유사한 문서 검색 → LLM이 답변을 생성하면 전체 프로세스가 에지에서 완료됩니다.
  • 다국어 번역 게이트웨이: 작업자 라우팅 기능과 결합되어 웹 요청이 AI 번역 레이어를 자동으로 통과하고 응답 내용이 백엔드 수정 없이 실시간으로 사용자가 선호하는 언어로 번역됩니다.
  • 콘텐츠 감사 및 보안 필터링: 요청이 원본 사이트에 들어가기 전에 Workers AI는 콘텐츠 감사 모델(텍스트/이미지)을 실행하고 불법 콘텐츠를 자동으로 차단하며 Cloudflare WAF와 협력하여 다계층 보호를 달성합니다.
  • 이미지 생성 및 처리: 에지 노드에서 Stable Diffusion을 실행하여 제품 이미지, 광고 크리에이티브 또는 개인화된 아바타를 생성하고 작업자 캐싱과 결합하여 반복적인 추론을 줄입니다.

해당자

  • 개인 사용자: 일상 업무 효율성 향상을 위해 AI 지원이 필요한 콘텐츠 제작자 및 지식 근로자입니다.
  • 개발자: API를 통해 AI 기능을 자체 제품이나 서비스에 통합해야 하는 기술팀입니다.
  • 기업: 해당 분야에 대규모로 AI를 배포하려는 조직입니다.

요약 및 전망

Cloudflare Workers AI의 핵심 경쟁력은 "글로벌 분산 인프라 + 서버리스 제로 운영 및 유지 관리 경험"에 있습니다. 이를 통해 독립 개발자는 백만 수준의 GPU 예산 없이도 글로벌 에지에서 AI 추론을 실행할 수 있습니다. Cloudflare 네트워크(D1 데이터베이스 R2 스토리지 큐 큐)와의 긴밀한 통합은 풀 스택 AI 애플리케이션을 구축할 때 시너지 효과를 크게 만듭니다.

부적합한 경계: 훈련 및 미세 조정(추론 배포만 해당)은 지원되지 않습니다. 모델 선택은 오픈 소스 모델로 제한되며 GPT-4 및 Claude와 같은 폐쇄 소스 모델은 기본적으로 실행하는 데 사용할 수 없습니다(AI Gateway를 통해 전달해야 함). 조달 위험: V8 Isolate 아키텍처는 장기간 추론을 실행할 때 CPU 시간 초과 제한(기본값 30초)을 트리거할 수 있습니다. 전용 GPU 인스턴스는 높은 동시성 시나리오에서 콜드 스타트 ​​지연이 발생할 수 있습니다. 지연에 민감한 기업은 전체 마이그레이션을 결정하기 전에 먼저 PoC를 사용하여 실제 성능을 확인하는 것이 좋습니다.

관련 도구: github-copilot, cursor

버전 정보

  • 근로자 AI 여름 2026 :Llama 4 시리즈 모델 지원, 실시간 음성-텍스트 추론 AI Gateway 2.0(캐싱 + 폴백 + 속도 제한) 및 사용자 정의 모델 업로드(LoRA 미세 조정) 기능이 추가되었습니다.
  • 근로자 AI 2025년 가을 :AI 게이트웨이 통합 관리 인터페이스 출시, 다중 공급자 롤백 지원(Workers AI→OpenAI→Anthropic), GPU 가속 벡터 데이터베이스 도입.
  • 노동자 AI GA :Workers AI는 공식적으로 GA로 출시되어 Mistral, Llama 및 Stable Diffusion과 같은 주류 오픈 소스 모델을 지원하며 추론 시간을 기준으로 요금이 청구됩니다.

사용자 후기

  • 후기를 불러오는 중...