에테르
무료
Aether는 동적 재구성, 동작 조건 비디오 예측 및 목표 지향적 시각적 계획을 동일한 아키텍처로 통합하는 기하학적 인식 세계 모델 프레임워크입니다. 연구팀이 세계 모델에 대한 기본적인 검증을 수행하는 데 적합합니다.
에테르 도구 텍스트
핵심 매개변수 및 통계
| 매개변수 | 최신 공개정보 | 설명 |
|---|---|---|
| 제품 포지셔닝 | 오픈 소스 세계 모델 연구 프레임워크 | 상용 SaaS가 아닌 연구 인프라 |
| 핵심과제 | 4D 재구성, 영상 예측, 시각적 계획 | 3개 작업 통합 아키텍처 |
| 라이센스 계약 | MIT 라이센스 | 연구 및 상업적 용도로 사용 가능 |
| 모델 가중치 | 공개(껴안는 얼굴) | AetherV1을 직접 다운로드할 수 있습니다 |
| 추론을 위한 상황별 요구사항 | Linux + CUDA + ≥24GB VRAM | 필요한 GPU 리소스 |
Aether 디자인의 출발점: 월드 모델의 가치는 "멋진 영상을 생성하는 것"뿐만 아니라 기하학적 공간을 이해하고 행동 결과를 예측하며 목표 계획을 지원하는 능력에도 있습니다.
사용자 및 시장 인지도
- InternRobotics는 특정 학문적 배경을 가진 팀입니다. 이 프로젝트는 MIT 라이센스에 따라 오픈 소스로 제공되며 이는 연구 및 상업용 응용 프로그램 모두에 여전히 열려 있음을 나타냅니다.
- 논문 제출부터 2025년 AetherV1 공개까지 빡빡한 속도는 프로젝트가 활발한 발전 단계에 있음을 보여줍니다.
- 공개 인용 횟수와 기업 사용자는 공개되지 않습니다. 성숙한 상용 제품보다는 연구 커뮤니티 도구로 생각하는 것이 더 좋습니다.
비용 이점
- C-side/개인: 일반 개인 사용자가 아닌 GPU 리소스를 보유한 연구자에게 더 적합합니다.
- 개발자/연구원: MIT 라이선스는 공개되어 있으며 다운로드 무게는 무료입니다. 주요 비용은 GPU 컴퓨팅 리소스입니다.
- 기업/개인: 상업용 구매 페이지가 없습니다. 기업이 이를 사용하려면 GPU 리소스 및 엔지니어링 액세스 비용을 스스로 평가해야 합니다.
실제 숨겨진 이점은 처음부터 세계 모델 실험 컨텍스트를 구축하는 시간을 줄이는 것입니다. 숨겨진 비용은 높은 VRAM 요구 사항과 Linux/CUDA 컨텍스트에 대한 의존성입니다.
주요 기능
- 4D 동적 재구성: 동적 장면에서 3차원 기하학적 구조를 재구성하여 정적 배경과 움직이는 객체를 구별합니다.
- 동작 조건 비디오 예측: 카메라 궤적을 동작 조건으로 사용하여 해당 미래 비디오 프레임 시퀀스를 예측합니다.
- 목표 조건 시각적 계획: 목표 상태가 주어지면 목표에 도달하는 데 필요한 시각적 경로의 순서를 추론합니다.
- 로컬 Gradio 데모: 빠른 검증을 용이하게 하기 위해 직접 실행할 수 있는 대화형 데모를 공식적으로 제공합니다.
- 공개 모델 가중치 및 추론 코드: AetherV1 가중치는 Hugging Face에서 호스팅되며 추론 스크립트는 GitHub 저장소에 공개됩니다.
모델 및 버전의 진화
- 2025-03-24/arXiv v1: 첫 번째 버전의 논문이 제출되고, 방법 설명 및 정량적 평가가 공개됩니다.
- 2025-03-28 / AetherV1 정식 출시: GitHub README를 통해 모델 가중치, 프로젝트 웹 사이트, 추론 코드가 동시에 공개되는 것을 확인합니다.
- 2025-07-28/arXiv v3: 업데이트된 설명과 지침을 포함하여 개정된 버전의 백서가 출시되었습니다.
Aether의 반복은 연구 완전성에 중점을 둡니다. 먼저 방법을 재현 가능하게 만든 다음 후속 작업으로 작업 범위를 확장합니다.
기술적인 장점
-
메커니즘: 기하학적 재구성과 생성적 모델링의 공동 최적화, 공유 공간 표현.
효과: 다양한 작업이 기하학적 사전 분포를 공유하여 다중 작업 독립적 모델링의 일관성 드리프트를 줄입니다. 적용 가능한 시나리오: 공간 인식, 자율 주행 장면 시뮬레이션이 필요한 세계 모델 연구.
-
메커니즘: 기하학적 정보를 바탕으로 한 행동 공간으로서의 카메라 궤적.
효과: 예측 및 계획에서는 추상 토큰 대신 보다 안정적인 기하학적 조건을 사용합니다. 적용 가능한 시나리오: 시각적 계획 및 동작 조건 비디오 예측에 대한 연구.
-
메커니즘: 3개 작업 통합 아키텍처(재구축 + 예측 + 계획) 공유 백본 네트워크입니다.
효과성: 각 작업에 대해 모델을 독립적으로 유지할 필요가 없으므로 연구 반복 비용이 절감됩니다. 적용 가능한 시나리오: 세계 모델에 대한 기초 연구, 구체화된 지능 다중 작업 검증.
사용방법
- 시작하기: GitHub 저장소 복제 → 종속 항목 설치(CUDA, 토치, 그라디언트 등) → AetherV1 가중치 다운로드 → 로컬 데모 실행.
- 연구 경로: AetherV1을 기반으로 실험 설계 → 작업 조건 수정 → 세 가지 작업의 성능을 평가합니다.
- 프로젝트 액세스 경로: MIT 라이선스 조건에 따라 자신의 연구 또는 응용 시나리오를 수정하고 통합합니다.
제품 가격
| 레벨 | 공개현황 | 설명 |
|---|---|---|
| 연구용 | 무료(MIT 라이센스) | 분동, 코드 및 문서는 모두 오픈 소스입니다 |
| 상업적 사용 | 허용됨(MIT 라이센스) | MIT 약관 적용 |
| 호스팅 서비스 | 비공개 | 아직 상용 API나 호스팅 솔루션이 없습니다 |
대부분의 연구팀의 주요 비용은 라이선스가 아니라 GPU 리소스와 엔지니어링 적응 시간입니다.
애플리케이션 시나리오
- 세계모델 기초연구: 형상인식 하의 통일된 모델링 방법을 검증한다.
- 자율 주행 장면 시뮬레이션: 동작 조건 영상 예측을 주행 장면 테스트에 사용할 수 있습니다.
- 구현된 지능형 계획 검증: 목표 조건 시각적 계획은 로봇 잡기 및 탐색 작업의 프로토타입 검증에 적합합니다.
해당자
- World Model Researchers: 기하학 인식 통합 모델링 방법을 검증하는 연구팀.
- 로봇공학/지능형 엔지니어: 4D 재구성 및 비전 계획에 대한 공동 검증이 필요한 팀.
- 자율주행 알고리즘팀: 장면 동적 예측 및 시각적 계획 연구를 수행하는 기술팀입니다.
경계에 맞지 않음: 기본적으로 제공되는 상업용 비디오 세대 SaaS가 아닙니다. GPU 리소스와 Linux 엔지니어링 기능이 없는 팀에서는 직접 사용할 수 없습니다.
요약 및 전망
해당 분야에서 경쟁력 있는 솔루션을 제공하며, 이 분야에서 AI 활용의 문턱을 낮추는 것이 핵심 가치입니다.
현재 제한 사항: 일부 고급 기능에는 유료 구독이 필요하며 무료 버전에는 기능 또는 사용 제한이 있습니다. 구체적인 기술 세부 사항과 성능 벤치마크는 아직 완전히 공개되지 않았습니다.
관련 도구: hugging-face, replicate
참조 소스
- https://aether-world.github.io/
- https://github.com/InternRobotics/Aether
- https://arxiv.org/abs/2503.18945
- https://huggingface.co/AetherWorldModel/AetherV1
버전 정보
- 에테르V1 :GitHub README에는 AetherV1 모델 가중치에 대한 주석이 명확하게 명시되어 있으며, 논문, 프로젝트 웹사이트 및 추론 코드가 공개되었습니다.
- arXiv v1 제출 :논문의 첫 번째 버전이 arXiv에 제출되었으며, Aether 방식과 평가 결과가 처음으로 공개되었습니다.
사용자 후기