제미나이 3.7 Flash는 코딩·기업 워크플로 벤치마크에서 3.6 Flash보다 크게 개선됐고, AutomationBench에서는 구글 공개 기준 Claude Sonnet 5보다 높은 점수를 기록했습니다. 다만 이 결과만으로 우리 회사 자동화 도입 모델을 결정하면 안 됩니다.

이 글의 핵심 3줄 요약
✔ 제미나이 3.7 Flash, 3주 만에 업무자동화 벤치마크 거의 2배 상승
✔ 클로드 소네트 5 대비 약 3배 높은 AutomationBench 완수율 기록
✔ 중소기업 AI 전환 관점에선 도입 전 업무 적합성 진단이 우선
01 제미나이 3.7 Flash, 왜 3주 만에 또 나왔나요

이례적으로 빠른 이유는 새 모델을 처음부터 재학습시킨 게 아니라, 기존 ‘제미나이 3.6 Flash’의 추론 능력을 알고리즘적으로 개선했기 때문입니다. 구글 딥마인드가 2026년 8월 13일 발표한 이 모델은 코딩·업무자동화에 특화된 저비용 AI로, 텍스트·이미지·음성·영상을 모두 이해하고 한 번에 원고지 약 2,500매 분량(100만 토큰)의 자료를 읽을 수 있습니다. 기업 업무자동화 벤치마크에서 클로드 소네트 5보다 약 3배 높은 점수를 받았다는 점에서, 단순한 마이너 업데이트로 보기 어렵습니다.
02 벤치마크 점수가 실제로 얼마나 올랐나요

코딩과 기업 업무자동화 영역에서 전작 대비 최대 1.8배 가까이 점수가 올랐습니다. 아래 표는 구글이 공개한 주요 벤치마크에서 3.6 Flash와 3.7 Flash를 비교한 결과입니다.
| 벤치마크 | 측정 항목 | 3.6 Flash | 3.7 Flash |
|---|---|---|---|
| FrontierCode 1.1 | 코딩 정확도 | 34.4% | 43.6% |
| DeepSWE v1.1 | 장기 소프트웨어 엔지니어링 과제 | 49.0% | 65.3% |
| AutomationBench | 기업 업무 자동화 완수율 | 17.0% | 30.4% |
| GDP.pdf | 복잡 문서 처리 정확도 | 22.0% | 34.0% |
| WebDev Arena | 웹 개발 실력 (Elo 점수) | 1538 | 1588 |
특히 눈여겨볼 항목은 ‘AutomationBench’입니다. 코딩 실력이 아니라 문서 정리, 일정 조율, 다단계 승인 처리 같은 실제 업무 프로세스를 얼마나 끝까지 완수하는지 측정하는데, 여기서 점수가 거의 두 배 뛰었다는 건 AI 비서가 시킨 일을 끝까지 처리해내는 능력이 크게 향상됐다는 의미입니다.
03 클로드·GPT와 비교하면 정말 더 강할까요

AutomationBench 기준으로 클로드 소네트 5보다 약 3배, GPT-5.6 테라보다 약 30% 높은 업무 완수율을 기록했습니다.
| 모델 | AutomationBench 점수 |
|---|---|
| 제미나이 3.7 Flash | 30.4% |
| GPT-5.6 테라 | 23.6% |
| 클로드 소네트 5 | 10.7% |
다만 이 수치는 구글이 자체 공개한 벤치마크이고, 실제 업무 체감 성능과 항상 정비례하지는 않는다는 점은 감안이 필요합니다. 항목별로 결과가 엇갈리기도 합니다. 장기 소프트웨어 엔지니어링 과제를 측정하는 ‘DeepSWE v1.1’에서는 GPT-5.6 테라(69.6%)가 제미나이 3.7 Flash(65.3%)보다 앞선다는 결과도 함께 공개됐습니다. 제3기관 아티피셜 애널리시스(Artificial Analysis)의 인텔리전스 인덱스에서는 제미나이 3.7 Flash(고성능 모드)가 56점을 받았습니다. (Artificial Analysis 벤치마크 페이지)
04 중소기업 AI 전환(AX)에 이 모델을 어떻게 활용할 수 있을까요

중소기업 AI 전환(AX) 관점에서 가장 눈에 띄는 대목은 ‘저렴한 가격 + 향상된 업무 완수율’의 조합입니다. 지금까지는 AI에게 반복 업무를 통째로 맡기려면 비용 부담이 만만치 않았는데, 이번 업데이트로 적은 비용으로도 끝까지 일을 마무리하는 AI에 한 걸음 더 가까워졌습니다. 견적서 초안 작성, 거래처 문의 메일 분류·회신, PDF 계약서 핵심 조건 추출 같은 업무는 GDP.pdf·AutomationBench가 측정하는 영역과 겹칩니다. 다만 벤치마크 점수가 높다고 곧바로 우리 회사 업무에 맞는다는 뜻은 아니므로, 도입 전 우리 회사의 어떤 업무가 자동화에 적합한지부터 객관적으로 진단해보는 과정이 먼저입니다.
05 도입 전에 꼭 확인해야 할 가격 정책은 무엇인가요
2026년 말까지 100만 토큰당 입력 0.75달러, 출력 3.75달러의 도입 특가로 제공되며, 이는 직전 모델 출시 당시 가격의 절반 수준입니다. 다만 이 특가는 한시적이며, 2027년 1월 1일부터는 입력 1.50달러, 출력 7.50달러로 오를 예정입니다. (구글 공식 발표 — Introducing Gemini 3.7 Flash) 지금 이 모델로 자동화 도구를 구축한다면, 특가 기간 중 충분히 검증하고 정가 전환 이후 비용까지 미리 계산해두는 것이 안전합니다.
도입 전 우리 회사 점검 체크리스트
- 반복 업무 중 문서 정리·메일 분류·계약서 검토처럼 AutomationBench·GDP.pdf 영역과 겹치는 업무가 있는가
- 현재 AI 도구에 들이는 월 비용과 2026년 말 특가 종료 이후 예상 비용을 비교했는가
- 소규모 파일럿(1~2개 업무)으로 먼저 테스트할 계획이 있는가
- 우리 회사 AI 활용 수준이 어느 단계인지 객관적으로 진단받아본 적이 있는가
Q. 제미나이 3.7 Flash는 무료로 쓸 수 있나요?
A. 소비자용 앱에서는 무료·유료 등급으로 제한적 체험이 가능하지만, 기업이 업무 자동화에 API로 연결하려면 100만 토큰당 입력 0.75달러·출력 3.75달러(2026년 말까지 특가)가 발생합니다.
Q. 클로드나 GPT 대신 무조건 이걸 써야 하나요?
A. 하나의 모델이 모든 업무에 정답은 아닙니다. AutomationBench에서는 앞섰지만 DeepSWE 같은 다른 영역에서는 GPT-5.6 테라가 앞서는 등 업무 성격에 따라 강점 모델이 달라, 목적에 맞게 병행 테스트하는 게 현실적입니다.
우리 회사 AI 수준, 지금 어디쯤일까요?
여러분은 지금 AI를 어떻게 활용하고 계신가요?
댓글로 현재 상황을 알려주시면, 업종별 맞춤 팁을 다음에 반영하겠습니다. 😊

<출처>
- Introducing Gemini 3.7 Flash — Google 공식 블로그: https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-gemini-3-7-flash/
- Gemini 3.7 Flash 모델 카드 — Google DeepMind: https://deepmind.google/models/model-cards/gemini-3-7-flash/
- Gemini 3.7 Flash launches three weeks after last model — 9to5Google: https://9to5google.com/2026/08/13/gemini-3-7-flash-launch/
- Google Cuts Gemini 3.7 Flash Price in Half as It Claims to Top Claude on Business Workflows — Tech Times: https://www.techtimes.com/articles/324387/20260813/google-cuts-gemini-37-flash-price-half-it-claims-top-claude-business-workflows.htm
- Gemini 3.7 Flash (high) — Artificial Analysis: https://artificialanalysis.ai/models/gemini-3-7-flash