Google 자체 Android 벤치마크: Gemini의 가격은 DeepSeek V4 Flash보다 17.5배 더 비쌉니다.
Google Android Bench 목록에 따르면 Gemini 3.5 Flash의 단일 운영 비용은 147달러인 반면 DeepSeek V4 Flash는 8.4달러로 가격 차이가 17.5배에 불과합니다. GPT-5.5는 74점으로 1위를 차지했으며, 국내 모델인 GLM, 키미, 딥식을 합쳐 순위에 올랐다.
Google의 자체 벤치마크 테스트가 뒤집혔습니다. Gemini의 가격은 DeepSeek의 17.5배입니다.
Google은 Android 개발 작업을 완료하는 AI 모델의 능력을 구체적으로 측정하는 벤치마크 테스트인 Android Bench 목록을 업데이트했습니다. 이는 개발자가 모델을 선택하는 데 강력한 참조 가치가 있습니다. 결과는 매우 아이러니합니다. Google이 I/O 2026에서 "현재까지 가장 강력한 플래시 모델"이라고 주장한 Gemini 3.5 Flash는 63.7점을 얻어 6위를 차지했습니다. 1회 실행 평균 비용은 $147.1(약 996위안)에 달해 전체 목록에서 가장 비싼 모델입니다. DeepSeek V4 Flash의 단일 실행 비용은 $8.4(약 57위안)에 불과합니다. 전자는 후자의 17.5배입니다.
결과 및 비용 세부정보 나열:
| 순위 | 모델 | 점수 | 여행 당 비용 |
|---|---|---|---|
| 1 | GPT-5.5 | 74.0 | — |
| 2 | GPT-5.4 | 72.4 | — |
| 3 | Gemini 3.1 Pro 미리보기 | 72.4 | ~$49 |
| 4 | 클로드 오푸스 4.7 | 68.7 | — |
| 5 | 클로드 오푸스 4.6 | 66.6 | — |
| 6 | Gemini 3.5 플래시 | 63.7 | $147.1 |
| 7 | GLM 5.1 | 59.7 | — |
| 8 | 키미 K2.6 | 58.6 | — |
| 10 | DeepSeek V4 프로 | 55.4 | — |
| 12 | DeepSeek V4 플래시 | 52.7 | $8.4 |
국산 모델로는 GLM 5.1(59.7점), Kimi K2.6(58.6점), DeepSeek V4 Pro(55.4점)가 동시에 순위권에 올라 개발자 도구 분야에서 중국 AI 모델의 집단적 존재감을 반영했다.
Google은 I/O 2026에서 Gemini 3.5 Flash 인코딩 기능이 경쟁 최첨단 모델보다 최대 4배 더 빠른 출력 속도로 더욱 강력했으며 일부 내부 벤치마크에서 Gemini 3.1 Pro보다 성능이 뛰어났다고 주장했습니다. 그러나 Android Bench의 실제 Android 개발 시나리오 데이터는 완전히 다른 결론을 내립니다. 점수가 상위 5위 안에 들지 못할 뿐만 아니라 가격 대비 성능 비율도 DeepSeek V4 Flash에 의해 무너졌습니다. Google 자체 벤치마크조차도 자체 모델의 체면을 보호할 수 없습니다. 개발자가 직접 투표하는 시대에 제조업체의 마케팅 수사는 실제 시나리오에서 얻은 비용 효율적인 데이터에 의해 체계적으로 위조되고 있습니다.
후기