ForgeTrain 무료

-

ForgeTrain은 Wallface Intelligence와 Tsinghua University의 OpenBMB 커뮤니티에서 출시한 오픈 소스 대규모 모델 사전 훈련 프레임워크입니다. 프레임워크 코드는 Forge Engineering의 3단계 방법론(표준 설정 → 비트별 정렬 → 성능 오버슈트)을 사용하여 AI Agent Loop에 의해 100% 자체 작성되었습니다. NVIDIA H100의 훈련 속도는 Megatron-LM의 훈련 속도를 약 10% 초과합니다. Huawei의 Ascend 칩에 대한 사전 훈련 과정을 완전히 거쳐 MiniCPM5-1B 모델을 성공적으로 훈련시켰습니다.

ForgeTrain 제품 인터페이스

ForgeTrain — AI 에이전트가 직접 작성한 대규모 모델 사전 훈련 프레임워크

핵심 매개변수 및 통계

ForgeTrain은 사람의 코드 개입 없이 전적으로 AI 에이전트에 의해 작성된 프로덕션 수준의 대규모 모델 사전 훈련 프레임워크입니다. Face Wall Intelligence와 칭화대학교 자연어 처리 연구소의 OpenBMB 오픈 소스 커뮤니티가 공동으로 출시한 이 버전은 개념 검증에서 생산 구현에 이르기까지 'AI를 위한 AI' 여정에서 중요한 이정표를 나타냅니다.

매개변수 항목 가치
개발자 Wall-Facing Intelligence(ModelBest) 및 Tsinghua University OpenBMB 커뮤니티
대상 시나리오 대규모 분산형 LLM 사전 학습(100칼로리~킬로칼로리 수준)
지원되는 하드웨어 NVIDIA H100(SM90)/Huawei Ascend 시리즈
검증된 모델 MiniCPM4-0.5B, MiniCPM4-8B, MiniCPM5-1B
훈련 프레임워크 규모 DP 전용(0.5B) 및 TP=2 / DP=4(8B) 지원
코드 작성 방법 100% AI 에이전트 루프 자체 생성, 사람 수동 편집 없음
오픈 소스 라이센스 아파치 2.0
훈련 처리량 H100의 MFU는 44.13%에 도달하여 Megatron-LM을 약 10% 능가
측정된 클러스터 64개의 H100 GPU, BF16 정확도, 분산 데이터 병렬
하네스 구성요소 곧 오픈 소스 제공 예정(Agent Loop의 자동 출력 훈련 프레임워크를 구동하는 스캐폴딩)

ForgeTrain의 MFU(Model FLOPS Utilization) 44.13%는 MiniCPM4-0.5B를 64× H100, BF16, 순수 DP 모드에서 훈련하여 측정되었습니다. 비교하자면, 동일한 하드웨어 구성에서 Megatron-LM v0.15의 MFU는 약 40%입니다. 이는 컴퓨팅 성능에 대한 동일한 투자로 ForgeTrain이 GPU 컴퓨팅 비용을 약 10% 절감하거나 동일한 예산으로 더 큰 모델을 교육할 수 있음을 의미합니다. 64개 카드 클러스터의 경우 10% 컴퓨팅 전력 절감은 수만 달러의 전력 및 시스템 시간 비용을 의미합니다.

사용자 및 시장 인지도

ForgeTrain은 출시 이후 학계와 업계로부터 폭넓은 주목을 받았습니다. 'AI 에이전트가 프로덕션 수준의 학습 프레임워크를 독립적으로 작성할 수 있다'는 명제를 처음으로 검증한 것이 핵심가치이다.

  • 학술 승인: 이 프로젝트는 칭화대학교 자연어 처리 연구소에서 인큐베이팅되었으며 관련 방법론은 상위 컨퍼런스의 제출 단계에서 발표되었습니다. 논문의 사전 인쇄에서는 AI 자율 쓰기 인프라에 대한 재현 가능한 이론적 프레임워크를 제공하는 Forge Engineering의 3단계 방법론을 인용합니다.
  • 산업적 구현: Wall-Facing Intelligence는 ForgeTrain을 사용하여 Huawei Ascend 칩에서 MiniCPM5-1B의 사전 훈련 프로세스를 완전히 실행했습니다. 이 모델은 크기가 2B 이하인 AA 목록에서 세계 1위를 차지했습니다. 이는 국내 칩이 처음으로 자체 작성 AI 훈련 스택을 통해 대형 모델의 생산 수준 사전 훈련을 완료하여 "훈련 프레임워크는 인간의 손글씨로 최적화되어야 한다"는 전통적인 경로 의존성을 깨뜨렸다는 것을 의미합니다.
  • 오픈 소스 커뮤니티: GitHub 저장소(OpenBMB/ForgeTrain)는 Apache 2.0 프로토콜에 따른 오픈 소스입니다. 커뮤니티 기여자에는 Wallface 핵심 팀과 외부 개발자가 포함됩니다. v0.1.0 훈련 엔진은 현재 출시되었으며 하네스 오케스트레이션 프레임워크(에이전트 루프 자동화 스캐폴딩)는 출시 예정 상태입니다.
  • 산업 벤치마킹: NVIDIA VibeTensor(프로덕션용이 아닌 것으로 표시됨), Anthropic C 컴파일러 OpenAI Harness와 같은 경쟁 제품과 비교할 때 ForgeTrain은 프로덕션 수준에서 동시에 사용할 수 있고 탁월한 성능을 가지며 완전한 오픈 소스인 유일한 AI 생성 프레임워크입니다. 이는 메타(Meta) 등 주요 제조사가 'AI 쓰기 AI'를 모색하고 있는 업계 맥락에서 중요한 참고 가치이자 엔지니어링 실증의의를 갖는다.

비용 이점

ForgeTrain의 비용 이점은 세 가지 수준에서 이해해야 합니다.

비교 차원 포지트레인 메가트론-LM(엔비디아) 필기 훈련 프레임워크
개발 비용 AI 에이전트는 독립적으로 작성되며 인적 투자는 0에 가깝습니다 수석 시스템 엔지니어 팀의 장기 유지 관리 필요 몇 개월에서 몇 년까지의 팀 개발 주기
컴퓨팅 효율성 44.13% MFU, 메가트론보다 약 10% 높음 ~40% MFU(동일 하드웨어) 팀 최적화 수준에 따라 다르며 일반적으로 성숙한 프레임워크보다 낮습니다
하드웨어 적응 H100 + Ascend 듀얼 플랫폼, 하네스가 자동으로 적응 가능 NVIDIA GPU 전용 각각의 새로운 하드웨어 적용에 필요한 재개발
라이센스 Apache 2.0은 완전한 오픈 소스이며 무료입니다 오픈 소스이지만 생태학적으로 잠겨 있는 CUDA 자체 연구 비용이 높다
훈련 결과 MiniCPM5-1B 생산레벨 모델 생산 개발 및 유지관리에 추가 인력 필요 전체 링크 지원이 필요합니다

C측 사용자: ForgeTrain은 개별 사용자를 직접 대상으로 하지 않습니다. 사용 임계값은 멀티 카드 GPU 클러스터를 갖춘 연구 기관 또는 기업을 위한 것입니다. 그러나 오픈 소스 및 무료 방법을 통해 컴퓨팅 리소스가 있는 모든 팀은 이를 무료로 확보하고 사용할 수 있습니다.

개발자 및 연구 기관: 오픈 소스 라이선스(Apache 2.0)는 무료 사용, 수정 및 상업적 사용을 허용합니다. 상용 라이센스 구매가 필요한 비공개 소스 교육 프레임워크와 비교할 때 ForgeTrain 채택 비용은 클러스터 하드웨어 및 전기 비용에 불과합니다. 학술 연구팀의 경우 이는 대규모 모델 사전 훈련 실험의 임계값을 크게 낮춥니다.

기업 사용자: ForgeTrain의 국내 칩 적응 혁신은 중요한 상업적 가치를 가지고 있습니다. 기업은 자체 개발한 CUDA 호환 스택을 개발하기 위해 N년을 기다릴 필요가 없습니다. ForgeTrain을 직접 사용하여 국내 칩에 대한 대규모 모델 교육을 시작할 수 있습니다. AI 인프라를 구축하는 중소기업의 경우 ForgeTrain을 채택하면 단일 GPU 공급업체에 얽매이지 않고 컴퓨팅 전력 비용을 10% 이상 절약할 수 있습니다.

주요 기능

  • 분산 사전 훈련 엔진: 수백에서 수천 개의 GPU의 분산 협업 훈련을 지원하고 64× H100 클러스터에서 프로덕션 수준 검증을 완료했습니다. 훈련 엔진에는 5개의 내장 CUDA 그래프 캡처 단위(forward / step / step_full / step_optimizer / step_nccl_opt)가 있으며, 이는 BucketedGradReducer 및 샤딩 최적화 프로그램 wgrad-overlap과 자유롭게 결합하여 다양한 규모의 훈련 작업을 위한 유연한 최적화 공간을 제공할 수 있습니다.
  • 크로스 하드웨어 플랫폼 적응: NVIDIA H100(SM90) 및 Huawei Ascend 시리즈 칩을 모두 지원합니다. H100의 MFU는 44.13%에 도달했으며 MiniCPM5-1B 사전 훈련 프로세스는 Shengteng에서 완전히 통과되었습니다. 이 듀얼 플랫폼 지원은 국내 컴퓨팅 파워 생태계 구축에 전략적으로 중요합니다. 모델 팀은 H100을 신속하게 반복하고 Ascend에서 프로덕션 배포를 완료할 수 있습니다.
  • AI Agent Loop 독립 개발: 프레임워크 코드는 자동 루프 모드에서 Coding Agent에 의해 완전히 독립적으로 생성되며, 인간은 하네스 사양과 컨텍스트만 제공합니다. 에이전트는 "참조 구현 읽기 → 코드 작성 → 훈련 시작 → 로그 구문 분석 → 근본 원인 위치 → 패치 수정 → 액세스 제어 전달 → 코드 제출"의 전체 개발 프로세스를 독립적으로 완료합니다. 각 운영자는 실제 분산 교육을 통해 검증되었습니다.
  • 자체 개발한 고성능 연산자 라이브러리: CuTeDSL을 기반으로 하는 5개의 맞춤형 GEMM 연산자가 포함되어 있으며 단일 연산자 MFU는 최대 90%입니다. 자체 개발한 FlashAttention 구현으로 성능은 Transformer Engine/FlashAttention 3을 능가하며 FlashAttention 4와 동일합니다. 연산자는 AOT C 내보내기를 통해 영구 캐시로 컴파일되며, 이로 인해 후속 교육에서 몇 초 동안만 'dlopen' 오버헤드가 발생합니다.
  • 비트별 일관성 검증: AI 생성 프레임워크와 참조 구현(Megatron-LM)은 동일한 입력에서 정확히 동일한 수치 결과를 생성합니다. 이는 Forge Engineering의 "비트별 정렬"의 두 번째 단계를 통해 달성됩니다. 에이전트는 하네스 제약 조건 하에서 참조 구현의 순방향/역방향 전파 결과를 정확하게 재현하여 성능 최적화 단계에 들어가기 전에 정확성을 보장합니다.
  • 자동 평가 하네스(출시 예정): 자동 테스트 및 성능 평가 내장

시스템은 "올바른 달리기"와 "빠른 달리기"를 기계가 자동으로 판단할 수 있는 기준으로 변환합니다. Harness에는 Agent Loop 조정 솔루션도 포함되어 있어 모든 팀이 비트별 정렬부터 성능 오버슈트까지 전체 프로세스를 재현할 수 있습니다.

모델 및 버전의 진화

ForgeTrain은 현재 v0.1.0의 초기 릴리스 단계에 있으며 프로젝트 로드맵은 명확합니다.

버전 출시일 다루는 내용
v0.1.0(현재) 2026-05 NVIDIA H100 · MiniCPM4-0.5B(DP 전용) 및 MiniCPM4-8B(TP=2)를 지원하는 트레이닝 엔진이 공개적으로 출시되었습니다. 교육 엔진 소스 코드, 5개의 CuTeDSL 사용자 정의 GEMM 및 자체 개발된 FlashAttention이 포함되어 있습니다.
하네스(출시 예정) 미정 에이전트 루프 오케스트레이션 스캐폴딩을 통해 Coding Agent는 훈련 프레임워크의 핵심 사양을 자동으로 생성할 수 있습니다. 'AI가 쓰는 AI'의 재현성을 실현하기 위한 핵심 부품이다.
화웨이 승천 버전 로드맵 MiniCPM5-1B Ascend 훈련 프레임워크가 실제로 구현되었으며 정식 버전이 출시될 예정입니다.
자체 생성 하네스 로드맵 훈련 프레임워크는 반복적인 자기 개선을 달성하기 위해 하네스 스캐폴딩을 자체 생성합니다.

v0.1.0은 프로젝트의 첫 번째 이정표로, AI 에이전트를 위한 프로덕션 수준 교육 프레임워크를 독립적으로 작성할 수 있는 가능성을 검증합니다. 다음 단계는 타사 팀이 이미 생성된 훈련 엔진을 사용하는 대신 Agent Loop의 훈련 프레임워크 생성 프로세스를 재현할 수 있도록 Harness 구성요소를 출시하는 것입니다.

기술적인 장점

ForgeTrain의 기술 아키텍처는 핵심 혁신 링크를 중심으로 전개됩니다. Forge 엔지니어링 방법론 → 에이전트 루프의 독립적 개발 → 고성능 교육 엔진 → 크로스 하드웨어 적응.

Forge Engineering의 3단계 방법론

Forge Engineering은 ForgeTrain의 기본 방법론으로, 세 단계로 나뉩니다.

  1. 표준 설정(Harnessing): 참조 교육 스택(Megatron-LM)에서 주요 운영 데이터를 수집하고, 자동화된 평가 하네스를 구축하고, 정확성 및 성능 벤치마크를 정의합니다. 하네스는 정적인 문서가 아니라 데이터 스트림 잘림, 수치 비교, 성능 임계값 및 기타 기계가 결정할 수 있는 표준을 포함하는 실행 가능한 사양 세트입니다.
  2. 비트별 복제: AI 에이전트는 하네스 제약 조건 하에서 참조 구현과 비트 단위로 일관된 훈련 프레임워크를 생성합니다. 이 단계에서는 성능이 아닌 정확성만 추구합니다. 에이전트가 생성한 코드의 출력이 동일한 입력에서 참조 구현과 완전히 일치하지 않는 경우 자동으로 롤백되고 복구됩니다.
  3. 성능 능가: 바이너리 일관성 제한을 해제하고 성능 지향 하네스로 전환하여 AI 에이전트가 더 큰 연산자 조합 공간에서 독립적으로 반복적으로 최적화할 수 있도록 하며 궁극적으로 속도 면에서 인간이 작성한 참조 구현을 능가합니다. 이 단계가 핵심입니다. 동일한 하네스 프로토콜이 서로 다른 하드웨어에서 완전히 다른 독점 최적화 구현을 구축할 수 있습니다.

Agent Loop 자체 개발

기존의 "사람이 코드 작성 → 컴파일 → 디버그" 주기와 달리 ForgeTrain의 코드는 완전히 자동화된 주기로 Coding Agent에 의해 완성됩니다.

LLM(코딩 에이전트) → 하네스 프로토콜 읽기 → 운영자 코드 생성 → torchrun 훈련 시작 → 로그 구문 분석 → 근본 원인 위치 → 코드 수정 → 숫자 게이트 통과 → 내보내기 제출/

이 사이클의 가장 큰 특징은 각 운영자의 세대가 실제 분산 교육을 통해 검증되었다는 것입니다. 개발 과정에서 에이전트는 CuTeDSL / cuBLAS / Triton / TransformerEngine 및 수십 가지 통신 + CUDA-Graph 캡처 조합과 같은 여러 연산자 구현 변형을 독립적으로 열거하고 벤치마킹했으며 최종적으로 성능이 가장 좋은 조합을 생산용 기본 구성으로 선택했습니다.

고성능 및 엔지니어링 최적화

  • 44.13% MFU 구현 메커니즘: CUDA Graph 5개 캡처 세분성(단일 운영자 MFU가 90%에 도달), Triton 융합 커널(CE fwd+bwd / SwiGLU / RMSNorm+residual / RoPE / fusion Adam + 매개변수 동기화) 및 통신-계산 오버랩(comm-computeoverlap)을 통한 CuTeDSL 맞춤형 GEMM, 순수 DP 모드에서 하드웨어의 이론적 한계에 접근합니다.
  • 추상화 손실 없음: 추상화 계층을 통해 다양성을 유지하는 기존 교육 프레임워크와 달리 ForgeTrain은 하네스 프로토콜의 다양성과 각 단조에서 높은 성능을 유지합니다. 이는 특정 하드웨어 및 모델 크기에 대해 생성된 코드에 불필요한 추상화 오버헤드가 포함되지 않음을 의미합니다.
  • 소비자 개발 개념: 코드를 장기 유지 관리를 위한 "자산"으로 취급하는 기존 소프트웨어와 달리 Forge Engineering은 코드를 분리하여 주문형으로 제작된 심층적인 맞춤형 제품으로 만듭니다. 하드웨어를 교체하거나 모델을 업그레이드할 때 이전 코드를 수정할 필요 없이 하네스 재단조를 직접 실행합니다.

사용방법

ForgeTrain의 사용은 생산된 훈련 엔진 사용(현재 사용 가능)과 Harness 자율 단조 훈련 프레임워크 사용(곧 출시 예정)의 두 가지 수준으로 나뉩니다.

학습 엔진 사용(v0.1.0)

입구 주소 설명
GitHub 저장소 https://github.com/OpenBMB/ForgeTrain 교육 엔진 소스 코드와 전체 문서가 포함된 기본 저장소
훈련 엔진 문서 수출/train_engine_0.5B/README.md 완전한 CLI 문서, 구성 참조, 0.5B 모델 교육 엔진의 성능 기준
훈련 엔진 문서 수출/train_engine_8b/README.md 8B 모델 교육 엔진에 대한 전체 문서

요구 사항: Python ≥ 3.11 · CUDA 12.x · PyTorch ≥ 2.4 · NVIDIA H100 80GB(SM90). 전체 사전 훈련에는 8× H100이 필요하며 초기 정렬 단계는 단일 카드에서 실행할 수 있습니다.

일반적인 단계:

  1. 저장소를 복제하고 종속성을 설치합니다: ``배쉬 자식 클론 https://github.com/OpenBMB/ForgeTrain.git cd ForgeTrain/exports/train_engine_0.5B pip 설치 -e . pip 설치 데이터 세트 변환기

  2. 설치 확인: ``배쉬 PYTHONPATH=src python -c "training_engine_tensor 가져오기 구성에서; 인쇄('확인')"

    
    예상 출력: `OK`
  3. 미리 컴파일된 연산자(첫 번째 실행): ``배쉬 PYTHONPATH=src CUSTOM_GEMM=1 OP_ATTENTION=v1 python scripts/precompile_ops.py

    
    이 명령은 AOT 내보내기 및 `cpp_extension` 빌드를 준비하여 5개의 CuTeDSL GEMM을 영구 캐시로 컴파일합니다.
  4. 단일 노드 8× H100 교육: ``배쉬 torchrun --standalone --nproc-per-node=8 \ -m training_engine_tensor 사전 훈련 \ --num-단계 200 \ --글로벌 배치 크기 1280 --마이크로 배치 크기 10 \ --seq 길이 4096 \ --hf-dataset openai/gsm8k \ --hf-dataset-config 메인 \ --hf-text-template "질문: {질문}\n답변: {답변}" \ --tokenizer-path openbmb/MiniCPM4-0.5B \ --save-dir ./체크포인트/run1

Forged with Harness(출시 예정)

하네스 구성요소가 출시된 후 팀은 다음과 같은 방법으로 독립적인 단조를 시작할 수 있습니다.

``배쉬 cd Forge트레인/하네스 bash Agent-loop.sh # 수동 개입 없이 에이전트 루프 시작



이 스크립트는 참조 훈련 스택 읽기부터 시작하여 비트별 정렬 및 성능 최적화를 통해 최종적으로 사용자 정의된 훈련 프레임워크를 생성하는 코딩 에이전트를 루프에서 실행하도록 구동합니다.

## 제품 가격

ForgeTrain은 현재 완전히 무료이며 오픈 소스이며 Apache 2.0 라이선스에 따라 라이선스가 부여됩니다.

- **오픈 소스 및 무료**: 교육 엔진의 전체 소스 코드와 문서가 GitHub에 공개되어 있으며 무료로 획득, 사용 및 수정할 수 있습니다. 상업적인 사용에는 추가 승인이 필요하지 않습니다.
- **하네스 구성 요소**: 곧 출시될 예정이며 Apache 2.0 라이선스에 따른 오픈 소스로도 제공될 예정입니다.
- **엔터프라이즈 지원**: Facewall Intelligence는 ForgeTrain의 엔터프라이즈급 배포 및 기술 지원 서비스를 제공합니다. 구체적인 가격은 사업주에게 문의하세요. 대규모 GPU 클러스터를 보유하고 훈련 스택을 맞춤화하려는 기업의 경우 하네스 맞춤화, 칩 적응 최적화 및 전문가 현장 서비스를 포함한 엔터프라이즈 수준 서비스를 협상할 수 있습니다.
- **클라우드/호스팅 서비스**: 현재 호스팅 교육 서비스가 없으므로 사용자가 직접 GPU 인프라를 관리해야 합니다. 향후 Facewall Intelligence가 ForgeTrain을 기반으로 한 모델 훈련 플랫폼을 출시할 가능성도 배제할 수 없습니다.

전반적으로 ForgeTrain의 가격은 개발자 커뮤니티에 매우 친화적입니다. 구매 비용 없이 프로덕션 수준의 교육 프레임워크를 얻을 수 있습니다. 기업의 숨겨진 비용에는 주로 하드웨어 투자와 GPU 클러스터에 대한 운영 및 유지 관리 인력이 포함되지만 사전 학습 프레임워크를 사용하면 이러한 비용을 피할 수 없습니다.

## 애플리케이션 시나리오

- **대형 모델 사전 훈련 및 미세 조정**: Megatron-LM 및 DeepSpeed와 같이 사람이 작성한 훈련 프레임워크를 직접 대체하며 생산 수준 대형 모델의 전체 사전 훈련 및 지침 미세 조정에 사용됩니다. ForgeTrain은 동일한 하드웨어에서 약 10%의 MFU 개선을 제공합니다. 이는 종종 수백 개의 카드가 필요하고 몇 주가 소요되는 대규모 모델 교육에 상당한 컴퓨팅 전력 절감 효과를 제공합니다. 예상되는 이점은 동일한 예산으로 더 큰 모델을 교육하거나 동일한 모델 크기로 교육 주기를 단축하는 것입니다.
- **국내 컴퓨팅 성능 적응**: ForgeTrain은 Huawei Ascend 칩에서 완전한 사전 교육 프로세스를 실행하는 최초의 자체 작성 AI 교육 프레임워크입니다. 국내 컴퓨팅 성능을 사용하는 국내 칩 제조업체 및 기업의 경우 ForgeTrain을 사용하면 또 다른 CUDA 생태계를 구축하는 데 10년을 투자하지 않고도 Ascend 및 기타 칩을 위한 독점적인 고성능 트레이닝 스택을 신속하게 구축할 수 있습니다. 예상되는 이점은 "칩 테이프 아웃"에서 "소프트웨어 가용성"까지의 시간이 크게 단축된다는 것입니다.
- **AI 연구 가속화**: ForgeTrain을 사용하면 "대형 모델의 연간 용량 증가를 인간 규모의 기능에서 컴퓨팅 성능 규모의 기능으로 전환"할 수 있습니다. 연구팀은 Harness를 사용하여 더 큰 검색 공간에서 독립적으로 반복하고 새로운 훈련 방법, 모델 아키텍처 및 최적화 전략을 빠르게 실험합니다. 예상되는 이점은 팀의 에너지를 교육 프레임워크 유지 관리에서 모델 알고리즘 혁신으로 전환할 것입니다.
- **소프트웨어 엔지니어링 패러다임 실험**: Forge Engineering의 최초 산업 수준 인스턴스인 ForgeTrain은 기타 복잡한 시스템(컴파일러, 데이터베이스, 운영 체제, 딥 러닝 런타임)을 위한 AI 자동 생성을 위한 참조 방법론 및 아키텍처 참조를 제공합니다. 연구팀은 ForgeTrain의 Harness 모델을 기반으로 자신의 분야에서 AI의 자율 개발을 탐색할 수 있습니다.
- **최종 모델 개발**: Wall-face Intelligence는 ForgeTrain을 사용하여 MiniCPM5-1B를 교육했으며 AA 목록에서 2B 미만 규모에서 세계 1위를 차지했습니다. 이는 ForgeTrain이 최종 측의 고효율 모델 개발에도 적합하다는 것을 증명합니다. 모바일 IoT와 같은 최종 측 배포 시나리오가 필요한 팀은

이 교육 과정을 직접 수강하세요.

## 해당자

- **대형 모델 교육 엔지니어 및 연구원**: ForgeTrain의 핵심 사용자 그룹입니다. 대규모 모델 사전 훈련을 위해 훈련 엔진을 직접 사용할 수도 있고, Agent Loop에서 생성된 연산자 코드를 조사하여 고성능 훈련 프레임워크의 구현을 배울 수도 있습니다. ForgeTrain의 오픈 소스 코드 베이스 자체는 "H100 고성능 교육 프로젝트"에 대한 실행 가능한 교과서입니다.
- **AI 인프라 팀**: 엔터프라이즈 AI 교육 인프라를 담당하는 기술 팀은 ForgeTrain을 사용하여 컴퓨팅 전력 비용을 절감(Megatron-LM에 비해 MFU 약 10% 향상)하는 동시에 하드웨어 간 지원을 통해 단일 칩 공급업체에 얽매이지 않을 수 있습니다. 교육 프레임워크 옵션을 조사하는 팀의 경우 ForgeTrain의 Apache 2.0 라이선스와 오픈 소스 커뮤니티 에코시스템을 통해 위험도가 낮고 장기적인 옵션을 얻을 수 있습니다.
- **국내 칩 생태계 개발자**: Ascend 및 Cambrian과 같은 국내 칩용 트레이닝 스택을 작성하는 개발자는 ForgeTrain의 Harness 방법론을 사용하여 처음부터 시작하는 대신 국내 칩용 전용 트레이닝 프레임워크를 빠르게 생성할 수 있습니다. Harness의 "프로토콜 기반 자동 단조" 모델은 인건비와 칩 적응 시간 주기를 줄여줍니다.
- **AI 에이전트 및 자동화 기술 매니아**: ForgeTrain은 "AI 만들기 AI"의 최첨단 사례입니다. Agent Loop, 자동 코드 생성, AI 자체 개선 및 기타 기술 방향에 관심이 있는 개발자는 구현 메커니즘을 자세히 알아볼 수 있습니다. 에이전트 친화적인 빠른 배포는 Coding Agent가 전체 배포 및 승인 프로세스를 독립적으로 완료할 수 있도록 설계되었습니다.

**군중에게는 적합하지 않음**: ForgeTrain은 고성능 GPU 클러스터가 없는 개별 개발자(단일 카드 또는 카드가 없는 사용자도 그 가치를 실현할 수 없음)에 적합하지 않습니다. 즉시 사용 가능한 SaaS 교육 서비스가 필요한 팀(ForgeTrain은 셀프 서비스 오픈 소스 프레임워크이며 호스팅 서비스를 제공하지 않습니다) 기본 CUDA/PyTorch에 대한 이해가 없고 엔지니어링 운영 및 유지 관리에 투자할 의지가 없는 팀 완전한 MLops가 필요합니다. 플랫폼(데이터 세트 관리, 실험 추적, 모델 등록 등)을 사용하는 기업은 이를 대체용이 아닌 기존 MLops 플랫폼과 함께 사용해야 합니다.

## 요약 및 전망

ForgeTrain의 핵심 경쟁력은 'AI-made AI'의 개념 단계부터 생산 단계 구현 단계까지 최초로 완전한 전환을 실현하는 능력에 있습니다. 이는 개념 증명 데모가 아니라 64개 카드 클러스터에서 실제 모델 가중치를 생성한 프로덕션 등급 교육 프레임워크입니다. Forge Engineering 방법론은 AI가 인프라 소프트웨어를 독립적으로 작성할 수 있는 재현 가능한 경로를 제공합니다. 표준 확립부터 비트별 정렬, 성능 오버슈트에 이르기까지 각 단계에는 명확한 통과 표준이 있습니다.

**현재 제한사항**:
- 제한된 지원 모델 범위: v0.1.0은 MiniCPM4-0.5B(DP 전용) 및 MiniCPM4-8B(TP=2)의 두 가지 구성만 검증했습니다. 규모가 더 크거나 아키텍처가 다른 모델에는 추가 적응 작업이 필요합니다.
- 하네스 구성 요소는 아직 오픈 소스가 아닙니다. 현재 사용자는 생성된 훈련 엔진만 사용할 수 있으며 아직 "독립 단조"의 전체 프로세스를 경험할 수 없습니다. Agent Loop 오케스트레이션 프레임워크의 출시는 커뮤니티에서 가장 기대되는 기능입니다.
- 높은 하드웨어 임계값: 전체 교육에는 H100 80GB 이상의 GPU가 필요하며 단일 카드로는 프로덕션 수준 사전 교육을 완료할 수 없으므로 개별 개발자의 참여가 제한됩니다.
- 커뮤니티 생태계는 초기 단계입니다. 성숙한 커뮤니티와 풍부한 문서를 보유한 Megatron-LM 및 DeepSpeed에 비해 ForgeTrain의 튜토리얼, 사례 및 타사 기여는 여전히 축적되고 있습니다.
- MLops 통합 부족: ForgeTrain은 훈련 엔진 자체에 중점을 두고 실험 관리, 모델 등록, 배포와 같은 MLops 기능을 포함하지 않으며 다른 도구와 함께 사용해야 합니다.

**조달 및 채택 위험 평가**: ForgeTrain을 구매하려는 기업의 경우 "선 파일럿, 소규모 검증, 확장" 전략을 채택하는 것이 좋습니다. 먼저, 프레임워크의 안정성 및 성능 데이터가 소규모 훈련 작업(예: 단일 노드 8카드 MiniCPM4-0.5B)에 대한 공식 데이터와 일치하는지 확인합니다. 확인 후 대규모 모델 학습으로 확장합니다. 다음 측면에 특별한 주의를 기울여야 합니다: Harness의 공식 출시 시간(자율 단조 워크플로 구현 가능 여부를 결정함), Wallface Intelligence의 과금 모델 및 기업 수준 지원을 위한 서비스 SLA, 프로젝트의 장기 유지 관리 지속 가능성. 기술적 위험 관점에서 ForgeTrain은 성숙한 오픈 소스 구성 요소(PyTorch, CUTLASS, FlashAttention)를 기반으로 하며 핵심 교육 엔진은 높은 신뢰성을 가지고 있습니다. 주요 위험은 하네스 구성 요소의 전달 품질과 커뮤니티 생태계가 계속 성장할 수 있는지 여부에 있습니다. 전반적으로 ForgeTrain은 잠재력이 큰 프로젝트이며 초기에 기술적 타당성을 입증했지만 주류 교육 프레임워크가 되기까지는 생태학적 구축을 거치는 데 여전히 오랜 시간이 필요합니다.

관련 도구: hugging-face, replicate

버전 정보

  • 최초 출시 :최초로 공개된 버전은 NVIDIA H100에서 MiniCPM4-0.5B 및 MiniCPM4-8B의 분산 사전 학습을 지원합니다. 훈련 엔진 소스 코드, 5개의 CuTeDSL 맞춤형 GEMM 연산자 및 자체 개발한 FlashAttention 구현을 포함합니다. 하네스 구성 요소(에이전트 루프 조정 프레임워크)가 출시될 예정입니다.
  • 최초 출시 :최초로 공개된 버전은 NVIDIA H100에서 MiniCPM4-0.5B 및 MiniCPM4-8B의 분산 사전 학습을 지원합니다.

사용자 후기

  • 후기를 불러오는 중...