에테르 무료

-

Aether는 동적 재구성, 동작 조건 비디오 예측 및 목표 지향적 시각적 계획을 동일한 아키텍처로 통합하는 기하학적 인식 세계 모델 프레임워크입니다. 연구팀이 세계 모델에 대한 기본적인 검증을 수행하는 데 적합합니다.

에테르 제품 인터페이스

에테르 도구 텍스트

핵심 매개변수 및 통계

매개변수 최신 공개정보 설명
제품 포지셔닝 오픈 소스 세계 모델 연구 프레임워크 상용 SaaS가 아닌 연구 인프라
핵심과제 4D 재구성, 영상 예측, 시각적 계획 3개 작업 통합 아키텍처
라이센스 계약 MIT 라이센스 연구 및 상업적 용도로 사용 가능
모델 가중치 공개(껴안는 얼굴) AetherV1을 직접 다운로드할 수 있습니다
추론을 위한 상황별 요구사항 Linux + CUDA + ≥24GB VRAM 필요한 GPU 리소스

Aether 디자인의 출발점: 월드 모델의 가치는 "멋진 영상을 생성하는 것"뿐만 아니라 기하학적 공간을 이해하고 행동 결과를 예측하며 목표 계획을 지원하는 능력에도 있습니다.

사용자 및 시장 인지도

  • InternRobotics는 특정 학문적 배경을 가진 팀입니다. 이 프로젝트는 MIT 라이센스에 따라 오픈 소스로 제공되며 이는 연구 및 상업용 응용 프로그램 모두에 여전히 열려 있음을 나타냅니다.
  • 논문 제출부터 2025년 AetherV1 공개까지 빡빡한 속도는 프로젝트가 활발한 발전 단계에 있음을 보여줍니다.
  • 공개 인용 횟수와 기업 사용자는 공개되지 않습니다. 성숙한 상용 제품보다는 연구 커뮤니티 도구로 생각하는 것이 더 좋습니다.

비용 이점

  • C-side/개인: 일반 개인 사용자가 아닌 GPU 리소스를 보유한 연구자에게 더 적합합니다.
  • 개발자/연구원: MIT 라이선스는 공개되어 있으며 다운로드 무게는 무료입니다. 주요 비용은 GPU 컴퓨팅 리소스입니다.
  • 기업/개인: 상업용 구매 페이지가 없습니다. 기업이 이를 사용하려면 GPU 리소스 및 엔지니어링 액세스 비용을 스스로 평가해야 합니다.

실제 숨겨진 이점은 처음부터 세계 모델 실험 컨텍스트를 구축하는 시간을 줄이는 것입니다. 숨겨진 비용은 높은 VRAM 요구 사항과 Linux/CUDA 컨텍스트에 대한 의존성입니다.

주요 기능

  • 4D 동적 재구성: 동적 장면에서 3차원 기하학적 구조를 재구성하여 정적 배경과 움직이는 객체를 구별합니다.
  • 동작 조건 비디오 예측: 카메라 궤적을 동작 조건으로 사용하여 해당 미래 비디오 프레임 시퀀스를 예측합니다.
  • 목표 조건 시각적 계획: 목표 상태가 주어지면 목표에 도달하는 데 필요한 시각적 경로의 순서를 추론합니다.
  • 로컬 Gradio 데모: 빠른 검증을 용이하게 하기 위해 직접 실행할 수 있는 대화형 데모를 공식적으로 제공합니다.
  • 공개 모델 가중치 및 추론 코드: AetherV1 가중치는 Hugging Face에서 호스팅되며 추론 스크립트는 GitHub 저장소에 공개됩니다.

모델 및 버전의 진화

  • 2025-03-24/arXiv v1: 첫 번째 버전의 논문이 제출되고, 방법 설명 및 정량적 평가가 공개됩니다.
  • 2025-03-28 / AetherV1 정식 출시: GitHub README를 통해 모델 가중치, 프로젝트 웹 사이트, 추론 코드가 동시에 공개되는 것을 확인합니다.
  • 2025-07-28/arXiv v3: 업데이트된 설명과 지침을 포함하여 개정된 버전의 백서가 출시되었습니다.

Aether의 반복은 연구 완전성에 중점을 둡니다. 먼저 방법을 재현 가능하게 만든 다음 후속 작업으로 작업 범위를 확장합니다.

기술적인 장점

  • 메커니즘: 기하학적 재구성과 생성적 모델링의 공동 최적화, 공유 공간 표현.

    효과: 다양한 작업이 기하학적 사전 분포를 공유하여 다중 작업 독립적 모델링의 일관성 드리프트를 줄입니다. 적용 가능한 시나리오: 공간 인식, 자율 주행 장면 시뮬레이션이 필요한 세계 모델 연구.

  • 메커니즘: 기하학적 정보를 바탕으로 한 행동 공간으로서의 카메라 궤적.

    효과: 예측 및 계획에서는 추상 토큰 대신 보다 안정적인 기하학적 조건을 사용합니다. 적용 가능한 시나리오: 시각적 계획 및 동작 조건 비디오 예측에 대한 연구.

  • 메커니즘: 3개 작업 통합 아키텍처(재구축 + 예측 + 계획) 공유 백본 네트워크입니다.

    효과성: 각 작업에 대해 모델을 독립적으로 유지할 필요가 없으므로 연구 반복 비용이 절감됩니다. 적용 가능한 시나리오: 세계 모델에 대한 기초 연구, 구체화된 지능 다중 작업 검증.

사용방법

  • 시작하기: GitHub 저장소 복제 → 종속 항목 설치(CUDA, 토치, 그라디언트 등) → AetherV1 가중치 다운로드 → 로컬 데모 실행.
  • 연구 경로: AetherV1을 기반으로 실험 설계 → 작업 조건 수정 → 세 가지 작업의 성능을 평가합니다.
  • 프로젝트 액세스 경로: MIT 라이선스 조건에 따라 자신의 연구 또는 응용 시나리오를 수정하고 통합합니다.

제품 가격

레벨 공개현황 설명
연구용 무료(MIT 라이센스) 분동, 코드 및 문서는 모두 오픈 소스입니다
상업적 사용 허용됨(MIT 라이센스) MIT 약관 적용
호스팅 서비스 비공개 아직 상용 API나 호스팅 솔루션이 없습니다

대부분의 연구팀의 주요 비용은 라이선스가 아니라 GPU 리소스와 엔지니어링 적응 시간입니다.

애플리케이션 시나리오

  • 세계모델 기초연구: 형상인식 하의 통일된 모델링 방법을 검증한다.
  • 자율 주행 장면 시뮬레이션: 동작 조건 영상 예측을 주행 장면 테스트에 사용할 수 있습니다.
  • 구현된 지능형 계획 검증: 목표 조건 시각적 계획은 로봇 잡기 및 탐색 작업의 프로토타입 검증에 적합합니다.

해당자

  • World Model Researchers: 기하학 인식 통합 모델링 방법을 검증하는 연구팀.
  • 로봇공학/지능형 엔지니어: 4D 재구성 및 비전 계획에 대한 공동 검증이 필요한 팀.
  • 자율주행 알고리즘팀: 장면 동적 예측 및 시각적 계획 연구를 수행하는 기술팀입니다.

경계에 맞지 않음: 기본적으로 제공되는 상업용 비디오 세대 SaaS가 아닙니다. GPU 리소스와 Linux 엔지니어링 기능이 없는 팀에서는 직접 사용할 수 없습니다.

요약 및 전망

해당 분야에서 경쟁력 있는 솔루션을 제공하며, 이 분야에서 AI 활용의 문턱을 낮추는 것이 핵심 가치입니다.

현재 제한 사항: 일부 고급 기능에는 유료 구독이 필요하며 무료 버전에는 기능 또는 사용 제한이 있습니다. 구체적인 기술 세부 사항과 성능 벤치마크는 아직 완전히 공개되지 않았습니다.

관련 도구: hugging-face, replicate

참조 소스

버전 정보

  • 에테르V1 :GitHub README에는 AetherV1 모델 가중치에 대한 주석이 명확하게 명시되어 있으며, 논문, 프로젝트 웹사이트 및 추론 코드가 공개되었습니다.
  • arXiv v1 제출 :논문의 첫 번째 버전이 arXiv에 제출되었으며, Aether 방식과 평가 결과가 처음으로 공개되었습니다.

사용자 후기

  • 후기를 불러오는 중...