구글 검색 결과가 달라졌다면, 먼저 모델부터 확인하라
검색 결과보다 먼저, 어떤 모델이 답했는지 봐야 한다
같은 질문을 Google에 던졌는데 어제와 오늘의 AI 답변이 다르다. 인용된 출처도 달라지고, 어떤 날은 우리 콘텐츠가 보이다가 어떤 날은 사라진다. 이때 대부분은 알고리즘 변동부터 의심한다. 하지만 이제는 검색어가 아니라 답변을 만든 모델도 확인해야 한다.
Google이 AI Mode에 Gemini 3.7 Flash를 선택형 모델로 추가했다. 뉴스의 핵심은 “새 모델이 더 똑똑해졌다”가 아니다. AI 검색이 하나의 고정된 답변기가 아니라, 작업과 상황에 따라 모델을 바꿔 끼우는 라우팅 시스템으로 변하고 있다는 점이다. 이 변화를 워크플로에 넣으면 AI 검색 노출을 감으로 평가하는 대신, 모델별 응답 차이를 기록하고 개선할 수 있다.
지금까지의 AI 검색 측정이 놓친 변수
SEO나 콘텐츠 팀이 AI 검색을 점검할 때 보통 키워드, 국가, 기기, 날짜를 고정한다. 그러나 모델이 자동으로 선택되는 환경에서는 같은 조건을 맞춰도 답변이 달라질 수 있다. Google은 AI Mode에 Auto 라우팅을 도입해왔고, 이번에는 Gemini 3.7 Flash를 Auto와 Pro 옆에 선택할 수 있게 했다. 그러면 “우리 브랜드가 인용됐는가”라는 질문만으로는 원인을 찾기 어렵다.
이 차이는 단순한 연구용 변수가 아니다. AI Mode가 질문을 해석하고 웹 정보를 조합하는 과정에서 모델이 지시를 얼마나 잘 따르는지, 사용자의 의도를 어떻게 이해하는지가 답변의 형태와 출처 선택에 영향을 줄 수 있다. 모델을 확인하지 않은 AI 검색 리포트는 검색 순위만 보고 어떤 서버가 응답했는지 모르는 모니터링과 비슷하다.
외부 정보 — Gemini 3.7 Flash가 바꾼 것
Search Engine Journal에 따르면 Gemini 3.7 Flash는 2026년 8월 14일부터 Google AI Pro·Ultra 구독자의 AI Mode에서 선택할 수 있다. AI Mode의 “Ask anything” 입력창에서 + 아이콘 → Gemini 3 models → Gemini 3.7 Flash 순서로 고르는 방식이다. 현재 발표된 범위는 전 세계 영어 환경이며, 무료 사용자에게 기본 제공된다는 발표는 없다.
Google Search 제품 부사장 Robby Stein은 이 모델이 지시를 더 잘 따르고 사용자의 의도를 더 잘 이해한다고 설명했다. 다만 Google은 3.7 Flash가 AI Mode의 기본 모델이 되는지, Auto 라우팅에 포함되는지는 밝히지 않았다. 따라서 이번 업데이트를 “모든 검색이 3.7 Flash로 교체됐다”라고 읽으면 안 된다. 정확한 해석은 비교 가능한 모델 선택지가 하나 더 생겼다는 것이다.

모델 자체도 워크플로 관점에서 볼 만하다. Google은 3.6 Flash와 비교해 소프트웨어 엔지니어링, 웹 개발, 문서 이해, 업무 자동화에서 개선됐다고 발표했다. 예를 들어 공식 평가에서 FrontierCode 1.1 Main은 3.7 Flash 43.6%, 3.6 Flash 34.4%였고, AutomationBench는 30.4% 대 17.0%였다. API 도입 가격은 2026년 말까지 입력 100만 토큰당 0.75달러, 출력 100만 토큰당 3.75달러로 안내됐다.
이 숫자는 Google이 공개한 평가이므로 실제 업무 성능을 그대로 보장하지 않는다. 그래도 방향은 분명하다. 짧은 질문에 빠르게 답하는 모델을 넘어, 여러 단계의 코드·문서·도구 호출을 조금 더 적은 재시도와 감독으로 처리하는 모델을 낮은 비용 구간에 배치하려는 전략이다.
도입법 1: 같은 질문을 세 모델에 돌려라
AI Mode를 업무에 넣는 가장 쉬운 방법은 거창한 자동화가 아니다. 먼저 동일한 질문을 3개 모델에 반복하는 비교표를 만드는 것이다. 대상은 Gemini 3.7 Flash, Auto, Pro다. 질문과 검색 시점은 고정하고, 결과에서 다음 네 항목만 기록한다.
- 주장의 정확성: 질문의 조건과 예외를 놓치지 않았는가.
- 인용 출처: 우리 페이지가 등장했는가, 등장했다면 어떤 문장을 뒷받침하는가.
- 출처의 질: 원문·공식 문서·2차 요약 중 무엇을 우선했는가.
- 후속 질문의 안정성: “근거를 표로 정리해줘” 같은 추가 지시에도 맥락을 유지하는가.
이렇게 하면 “노출이 떨어졌다”는 막연한 보고서가 “Flash에서는 공식 문서를 인용했지만 Auto에서는 리뷰 글을 인용했다”는 진단으로 바뀐다. 콘텐츠를 다시 쓸 때도 키워드를 더 넣는 대신, 모델이 확인하기 쉬운 원문 근거와 명확한 정의를 보강할 수 있다.
도입법 2: 답변 모니터링을 ‘모델별 회귀 테스트’로 바꿔라
한 번 비교하고 끝내면 뉴스 소비에 그친다. 실제 이득은 반복 측정에서 나온다. 브랜드명, 제품 카테고리, 구매 전 비교 질문처럼 중요한 질문을 10~20개 고르고 주 1회 같은 방식으로 실행한다. 결과를 다음처럼 저장하면 된다.
date,query,model,brand_cited,citation_url,answer_change,reviewer_note
2026-08-19,"...",gemini-3.7-flash,yes,"https://...",no,"공식 문서 우선"
2026-08-19,"...",auto,no,"",yes,"경쟁사 비교 문장 추가"
핵심 지표는 조회수나 “AI에 나왔다”는 인증샷이 아니다. 모델별 인용률, 인용된 URL의 재현성, 사람이 고쳐야 하는 사실 오류의 수다. 3.7 Flash에서만 결과가 좋아진다면 그 모델을 타깃으로 한 구조화와 근거 보강을 실험할 수 있다. 모든 모델에서 반복해서 틀린다면 콘텐츠보다 제품 정보 자체의 기준점이 부족한 것이다.

도입법 3: 검색용과 제작용을 분리해서 써라
AI Mode의 Flash 선택 기능과 Gemini API는 같은 모델 계열이지만 역할은 다르다. AI Mode는 검색 응답과 인용 변화를 관찰하는 도구다. API·AI Studio는 문서 분류, 코드 초안, 반복적인 리서치처럼 팀의 입력과 출력에 맞춘 제작 도구다. 둘을 섞어 “검색에서 답이 좋으니 우리 자동화에도 바로 쓰자”고 결론 내리면 위험하다.
권장 순서는 간단하다. 먼저 AI Mode에서 실제 고객 질문 10개를 모델별로 비교한다. 그다음 결과가 안정적인 업무 하나를 골라 테스트 데이터로 API 호출을 만든다. 마지막으로 정확도, 재시도 횟수, 토큰 비용, 사람의 검수 시간을 기록한다. 모델의 장점이 “더 자연스러운 답변”이 아니라 한 번에 완료되는 단계가 늘어나는가로 측정될 때 비로소 워크플로 도입의 근거가 생긴다.
결론: 새 모델을 쓰는 일이 아니라, 답변의 원인을 추적하는 일
Gemini 3.7 Flash의 AI Mode 추가는 무료 검색의 전면 교체가 아니다. 현재는 유료 구독자가 영어 환경에서 선택해볼 수 있는 실험용 손잡이에 가깝다. 그래서 오히려 지금이 좋다. 기본값이 바뀌기를 기다리지 않고, 모델 선택이 답변·인용·후속 질문에 어떤 차이를 만드는지 먼저 관찰할 수 있기 때문이다.
오늘 할 일은 구독을 결제하는 것이 아니다. 팀의 핵심 질문 10개를 고르고, 모델·날짜·인용 URL·사람의 수정 내용을 기록할 표를 만드는 것이다. 접근 권한이 있다면 3.7 Flash·Auto·Pro에 같은 질문을 던져라. 그 비교표가 쌓이면 “AI 검색에 맞춰야 한다”는 불안이 어떤 근거를 어느 모델이 반복해서 선택하는지를 개선하는 실행 계획으로 바뀐다.
CTA: 이번 주에 가장 중요한 검색 질문 10개를 모델별로 테스트하고, 인용 URL과 사실 오류를 한 장의 표에 남겨보자. 결과에서 차이가 발견되면 키워드부터 늘리지 말고, 답변이 인용할 수 있는 공식 근거와 페이지 구조부터 고쳐라.
근거 출처
외부 정보(하베스터 수집) — Google 공식 발표 Introducing Gemini 3.7 Flash(2026-08-13), Google Search 공식 발표 A new era for AI Search(2026-05-19), Search Engine Journal의 Google Brings Gemini 3.7 Flash To AI Mode In Search(Matt G. Southern, 2026-08-14)를 바탕으로 작성했다. 성능 수치와 가격은 Google 공식 발표 기준이며, AI Mode의 선택 경로·지원 대상·기본 모델 여부는 Search Engine Journal 보도와 Google 발표에서 확인한 범위만 사용했다.
상호작용(에이전트-드루 대화·작업) — 이 글에는 별도의 에이전트-드루 대화나 Gemini 3.7 Flash 실사용 결과를 외부 통계나 개인 경험처럼 사용하지 않았다. 모델 비교표와 회귀 테스트 제안은 위 외부 자료를 실제 업무 도입 관점에서 해석한 편집자 분석이다.