제미나이 temperature 폐지 — 공식 문서 네 쪽이 갈렸고, 모델 50개 중 43개는 아직 그 값을 싣고 있어요
제미나이 릴리스 노트가 샘플링 파라미터 세 개를 폐지로 선언했는데, API 레퍼런스는 아직 Optional이고 텍스트 생성 가이드는 예제에 그대로 넣어요. 지금 보내면 어떻게 되는지 모델 다섯 개에 직접 쳐 봤어요. 2026년 8월 22일 오후 관측이에요.
AI 기술을 누구나 쉽게 활용할 수 있도록 실전 가이드를 작성합니다. ChatGPT, Claude, AI 자동화, SEO 분야를 전문으로 다룹니다.
5월 19일 구글 I/O 2026에서 Gemini 3.5 Flash가 정식 출시되면서 발표 당일 바로 일반 사용 가능 상태로 풀렸어요. 가격은 $1.50/$9, 출력 속도 289 tok/s, Terminal-Bench 76.2%로 작년 Gemini 3.1 Pro($2/$12)를 벤치마크에서 이기면서 가격은 25% 더 싸요.
핵심 변화 3가지. (1) 벤치마크 역전 — Terminal-Bench 2.1 76.2% vs 3.1 Pro 70.3%(+5.9%p), MCP Atlas 83.6%, GDPval-AA 1656 Elo. Flash가 Pro를 이기는 첫 사례. (2) 289 tok/s 속도 — 다른 프런티어 모델 대비 약 4배, Gemini 3 Flash 대비 70% 빠름. (3) 1M 컨텍스트 표준 — 1,048,576 입력 + 65,536 출력 토큰. RAG·긴 문서 분석에 그대로 활용 가능.
이번 글은 7가지 작업에서 어디가 3.5 Flash로 본전이고 어디서 Opus 4.7·GPT-5.5를 불러야 하는지, 한국 1인 개발자 기준 월 비용 구조가 어떻게 달라지는지 정리해요. 가격·벤치마크·컨텍스트 한도는 구글 공식 발표 기준이고, 작업별 판단은 공개된 스펙과 일반적인 사용 패턴을 근거로 정리했습니다.

가장 본전이 큰 패턴. 사용자 질문 → AI 답변 형식의 일상 챗봇은 3.5 Flash 단독으로 충분해요. 출력 속도가 289 tok/s라 짧은 한국어 응답은 체감상 거의 기다림이 없고, 단가도 GPT-5.5보다 크게 낮습니다.
비용 감각을 잡으려면 본인 챗봇의 월 입력·출력 토큰을 먼저 뽑아 보세요. 그 숫자에 3.5 Flash 단가($1.50/$9)와 현재 쓰는 모델의 공식 단가를 각각 곱하면, 옮겼을 때 실제로 얼마가 줄어드는지 바로 나옵니다. 트래픽이 일정한 챗봇일수록 이 계산이 잘 맞아요.
조건 — 답변 정확도가 작년 Pro급이라 일상 질문(FAQ·요약·번역·간단 분석)은 차이를 느끼기 어려워요. 복잡 추론(수학 문제·법률 해석·코드 디버깅)에서만 GPT-5.5·Opus 4.7이 안정적. 일반적인 챗봇은 질문 대부분이 일상 영역이라, 기본은 3.5 Flash로 받고 복잡한 질문만 GPT-5.5로 라우팅하는 구성이 본전이에요.
두 번째 본전 패턴. 같은 시스템 프롬프트 + 다른 사용자 입력을 대량 처리하는 작업(RAG·문서 분류·리뷰 분석·이메일 자동 분류). 캐시 활용 시 입력 비용이 $1.50 → $0.15(90% 절감).
권장 패턴 — 시스템 프롬프트를 길게 작성하고 변하지 않는 컨텍스트를 앞쪽에 배치한 뒤, 사용자 입력만 뒤쪽에서 교체하세요. 캐시 TTL이 5분이라 같은 사용자 세션 안에서는 적중률을 높게 유지할 수 있어요. 캐시 입력이 $0.15라 적중률이 올라간 만큼 입력 비용이 그대로 줄어드는 구조입니다.
대량 배치 활용 예시 — (1) 쇼핑몰 리뷰 5,000개 감성 분류, (2) 고객 이메일 1만 개 카테고리 분류, (3) 블로그 글 3,000개 SEO 메타 자동 생성, (4) PDF 100개 요약. 3.5 Flash 캐시 + 1M 컨텍스트 조합이 가장 비용 효율적이에요. 외주 비용 환산 시 약 5만원/시간 작업이 모델 호출 약 $5 + 자동화 코드 작성 1시간으로 압축돼요.
세 번째 패턴. MCP 서버 호출 5~10단계 멀티 스텝 에이전트(파일 읽기 → API 호출 → 데이터 가공 → 결과 저장). MCP Atlas 벤치마크 83.6%로 3.1 Pro 대비 우위.
5단계 MCP 호출(GitHub 이슈 읽기 → 코드 분석 → 수정 PR 생성 → 알림 발송 → 로그 기록) 같은 흐름은 단계마다 대기 시간이 누적되기 때문에, 모델 하나의 응답 속도 차이가 전체 작업 시간에서 몇 배로 벌어집니다. 에이전트를 하루에 수십 번 돌리는 구조라면 속도와 단가 차이가 함께 곱해져서 월 비용 격차도 커져요.

조건 — MCP 도구 정의가 정확해야 함. 도구 설명이 모호하면 3.5 Flash가 잘못된 도구를 고르는 경우가 GPT-5.5보다 잦은 편이에요. 도구 description·input schema를 명확하게 작성하면 거의 차이 없어집니다. 도구 정의 잘 안 된 환경에서는 GPT-5.5 안정성 유지.
네 번째 패턴. RAG(Retrieval-Augmented Generation) 시스템에서 검색 결과 컨텍스트가 200K~500K 토큰 영역. 3.5 Flash는 1M 컨텍스트 표준 지원이라 그대로 활용 가능.
전형적인 구성은 이래요. 사내 문서 수백 개를 시스템 프롬프트에 넣어 두고 사용자 질문만 뒤쪽에서 교체하면, 문서 부분이 캐시에 걸려서 쿼리당 입력 비용이 크게 떨어집니다. 문서가 자주 바뀌지 않는 사내 위키·매뉴얼 챗봇에서 특히 잘 맞아요.
권장 패턴 — (1) 작은 RAG(100~200K)는 캐시 + 1회 호출, (2) 중간 RAG(200~500K)는 캐시 + 답변 검증 위해 GPT-5.5·Opus 4.7 1회 추가, (3) 큰 RAG(500K~1M)는 컨텍스트 압축(요약 단계 1번 추가) 후 3.5 Flash 호출. 문서 갱신 주기가 짧다면 캐시가 자주 깨지니 압축 단계를 먼저 두는 편이 유리합니다.
다섯 번째 패턴. IDE 코드 자동완성·간단 함수 생성. SWE-Bench Pro 55.1% vs GPT-5.5 약 58%, Opus 4.7 약 64%. 3.5 Flash가 SWE 단독 작업에서는 약간 뒤지지만 일상 자동완성은 거의 동급.
TypeScript·Python처럼 패턴이 반복되는 일상 자동완성은 정확도 차이를 체감하기 어려운 반면 단가 차이는 크게 벌어져요. 그래서 자동완성 같은 고빈도·저난도 호출은 3.5 Flash가 본전입니다. 단 복잡 디버깅·신규 모듈 설계는 Opus 4.7·GPT-5.5가 안정적이에요. 분업 패턴 — 자동완성 3.5 Flash, 신규 설계 Opus 4.7.
조건 — Cursor·Windsurf 같은 IDE는 자체 모델(Composer 2.5·SWE-1.5)이 있어서 3.5 Flash 직접 호출은 잘 안 씀. 자체 IDE를 만들거나 VSCode 확장을 직접 개발할 때 3.5 Flash가 비용·속도 균형이 좋아요.
여섯 번째 패턴. 이미지·차트·PDF 시각 분석. CharXiv 벤치마크 84.2%로 멀티모달 강점. 한국어 인포그래픽에서 텍스트를 뽑아 요약하는 정도의 작업은 상위 모델과 결과 차이가 크지 않은 반면 단가 차이는 뚜렷해서 3.5 Flash가 본전이에요.
활용 예시 — (1) 영수증 OCR + 카테고리 분류, (2) 차트 이미지 → 데이터 추출, (3) PDF 보고서 100페이지 요약, (4) 한국어 손글씨 노트 텍스트 변환. 비전 작업이 많은 1인 개발자(회계·교육·문서 자동화 SaaS) 본전 패턴.
조건 — 매우 복잡한 차트(여러 축·중첩 데이터)는 Opus 4.7 고해상도 비전(2576px)이 강점. 일상 이미지는 3.5 Flash, 복잡 차트는 Opus 4.7 분리.
일곱 번째 패턴 — 유일한 약점. 한국어 자연스러운 글쓰기·창작·번역에서는 3.5 Flash 결과물이 GPT-5.5·Opus 4.7보다 눈에 띄게 뻣뻣해요. 같은 프롬프트로 한국어 블로그 초안을 뽑아 나란히 읽어 보면 문장 리듬과 어휘 선택에서 차이가 바로 드러납니다.
증상 — (1) 어색한 직역체 ("~합니다"·"~할 수 있습니다" 남용), (2) 한국 문화 컨텍스트 부정확(존댓말 수준·세대 차이), (3) 긴 글 일관성 약함. 글쓰기·콘텐츠 생성은 GPT-5.5·Opus 4.7이 안정적. 3.5 Flash는 글쓰기 외 작업에서 본전.
내부 링크: GPT-5.5 새 토크나이저 활용은 GPT-5.5 토크나이저 7가지 팁에서, Claude Opus 4.7 가격 최적화는 Opus 4.7 1M 컨텍스트 비용 7가지에서, Gemini 3.1 Flash-Lite 활용은 Gemini 3.1 Flash-Lite 7가지 사용법에서 확인하면 좋아요.
7가지 작업을 한 줄로 요약. 일상 챗봇·대량 배치·MCP 에이전트·RAG·자동완성·비전은 대부분 3.5 Flash 단독, 한국어 글쓰기·복잡 추론만 Opus 4.7·GPT-5.5 분리. 호출 대부분을 단가가 낮은 모델로 옮기고 소수의 어려운 작업만 상위 모델에 남기는 구조라, 절감 폭은 본인 작업 분포에 따라 달라집니다.
지금 당장 할 일 — (1) Google AI Studio에서 API 키 발급 + 무료 티어로 1주일 테스트, (2) 본인 사용 작업 8가지 카테고리로 분류 후 3.5 Flash·Opus 4.7·GPT-5.5 분업 라우터 설계, (3) 시스템 프롬프트 캐시 최적화로 적중률 80%+ 달성, (4) 트래픽 발생 시 Vertex AI 마이그레이션 + 사업자 세금계산서.
3.5 Flash로 갈아탈 때 자주 나오는 실수. (1) 모든 작업 3.5 Flash 의존 — 한국어 글쓰기는 어색해서 GPT-5.5 라우팅 필수. (2) 캐시 최적화 안 하고 비용 비교 — 캐시 적중률 0%면 본전 약함, 80%+로 끌어올려야 함. (3) AI Studio 무료 티어로 프로덕션 — 데이터 학습 사용 위험, 트래픽 발생 시 즉시 Vertex AI 이동. (4) MCP 도구 정의 모호 — 도구 description·schema 정확해야 3.5 Flash 정확도 유지. (5) 3.5 Pro 6월 출시 기다리지 않고 3.1 Pro 유지 — 3.1 Pro $2/$12 → 3.5 Flash $1.50/$9 즉시 마이그레이션이 본전.
한국 1인 개발자 추가 팁. (1) asia-northeast3 서울 리전 — Vertex AI 한국 리전을 쓰면 미국 리전 대비 네트워크 왕복이 짧아 응답이 더 빠르게 느껴져요. (2) 트래블월렛 환차익 — GCP 결제 카드 등록 시 약 1% 절감. (3) 세금계산서 + 부가세 환급 — 사업자 등록 후 GCP 영업팀 요청, 월 비용의 10% 환급. (4) 3.5 Pro 6월 대기 전략 — 가격 약 $3/$15 예상이면 본인 작업이 Pro급 필요한지 미리 측정. (5) 장애 대비 GPT-5.5 fallback — 3.5 Flash 장애 시 자동 GPT-5.5 라우팅 코드 1줄 추가, 가용성 99.9% 유지.
절감 폭은 사람마다 다르기 때문에 남의 숫자보다 본인 로그가 정확해요. 첫 주에 이 7가지만 기록해 두면 판단이 끝납니다. (1) 총 호출 수 — 하루·주 단위 합계. (2) 모델별 호출 비중 — 3.5 Flash·GPT-5.5·Opus 4.7이 각각 몇 퍼센트인지. (3) 호출 사유 — 상위 모델을 부른 이유가 한국어 글쓰기인지 복잡 추론인지 구분. (4) 모델별 입력·출력 토큰. (5) 캐시 적중률 — 캐시 입력 단가가 10분의 1이라 여기서 비용이 가장 크게 갈립니다. (6) 모델별 실제 청구액 — GCP·OpenAI 콘솔 값 그대로. (7) 평균 응답 시간 — 사용자가 기다리는 화면이 있으면 비용만큼 중요해요.
일주일 치가 쌓이면 "상위 모델 없이도 됐을 호출"이 눈에 보입니다. 그 비중이 절감 가능한 상한선이고, 여기에 각 모델의 공식 단가를 곱하면 이전 후 월 비용이 바로 나와요. 감으로 옮기지 말고 이 표를 먼저 만드는 편이 훨씬 빠릅니다.
마지막. Gemini 3.5 Pro가 구글 내부 사용 중, 6월 공개 예정. 가격은 약 $3/$15 예상(3.1 Pro $2/$12에서 인상). 권장 전략은 (1) 3.5 Flash로 일단 일상 작업 이전, (2) 6월 3.5 Pro 출시 후 복잡 작업 GPT-5.5·Opus 4.7 → 3.5 Pro 마이그레이션 테스트, (3) 3.5 Pro 벤치마크·가격이 Opus 4.7보다 본전이면 Opus 4.7 호출 축소. 3.5 Pro 대기하면서 3.1 Pro 그대로 쓰는 건 가장 손해 — 3.5 Flash가 3.1 Pro를 이미 벤치마크에서 이기는데 가격 25% 더 싸요. 무조건 3.5 Flash로 즉시 이동이 정답.
분업 라우터 패턴을 한국 1인 개발자가 그대로 활용할 수 있게 정리했어요. 핵심은 작업 종류에 따라 자동으로 모델을 선택하는 단순 함수 한 개로 비싼 모델 호출을 걷어내는 거예요. 라우팅 규칙은 작업 카테고리 라벨링 + 키워드 매칭 + 신뢰도 점수 임계값 조합. 작업이 들어오면 라우터 함수가 카테고리를 분류하고 적절한 모델로 전송하는 흐름. 한국어 자연어 처리 작업이면 GPT-5.5, 코드 디버깅 복잡도가 높으면 Opus 4.7, 나머지 일상 작업은 모두 3.5 Flash로 라우팅하는 게 본전이에요.
라우팅 단계 5가지. (1) 작업 라벨 추출 — 사용자 입력에서 작업 종류(분류·요약·번역·코드·글쓰기·분석) 자동 추출. 첫 호출은 3.5 Flash로 라벨링만 시키면 저비용. (2) 카테고리 매핑 — 라벨을 5개 카테고리(일상·창작·코드·분석·복합)로 매핑. 매핑 테이블은 본인 사용 패턴을 1주일 측정한 뒤 조정하세요. (3) 신뢰도 점수 — 카테고리 매핑 신뢰도가 낮으면 무조건 GPT-5.5로 안전 라우팅. 신뢰도 0.8 이상만 3.5 Flash 단독 처리. (4) fallback 체인 — 3.5 Flash 실패·timeout 시 자동 GPT-5.5 재호출. 가용성 99.9% 유지. (5) 비용 로깅 — 각 호출의 모델·토큰·비용 기록 → 주간 리포트 자동 생성. 본인 사용 패턴 변화 추적.
이 라우터 패턴을 1주일 운영하면 본인 작업 분포가 명확히 보입니다. 대부분은 일상 작업이 압도적으로 많고 창작·복합 추론은 소수인데, 비용은 그 소수가 끌어올리는 구조라 라우팅만 정리해도 청구액이 눈에 띄게 내려가요. 모델을 매번 손으로 고르던 시간이 사라지는 것도 덤입니다.
3.1 Pro를 쓰던 사용자가 3.5 Flash로 옮길 때 사고 없이 마이그레이션하는 5단계. (1) API 모델 ID 변경 — gemini-3.1-pro → gemini-3.5-flash. SDK 버전이 최신인지 확인 + 한 줄 교체. (2) 출력 토큰 한도 점검 — 3.1 Pro 8K → 3.5 Flash 65K로 출력 한도 증가. 길게 받는 작업은 max_output_tokens 명시 조정. (3) 응답 형식 검증 — JSON 출력·구조화 응답이 3.5 Flash에서 약간 다르게 나올 수 있음. 1주일 A/B 테스트 후 프로덕션 이동. (4) 시스템 프롬프트 캐시 활성화 — 3.5 Flash는 캐시 자동 적용이지만 시스템 프롬프트 변동 적게 유지해야 적중률 80%+. (5) 비용 모니터링 알람 — GCP 결제 알람 일 한도 설정, 예상 비용 대비 2배 초과 시 알림.
마이그레이션 사고 예방 3가지. (1) JSON 스키마 강제 — 응답 형식이 미묘하게 달라서 클라이언트 파싱 깨질 수 있음. response_schema 명시로 안전. (2) temperature·top_p 동일 유지 — 모델 바뀌어도 같은 파라미터 유지로 응답 일관성 보존. (3) 로그 비교 1주일 — 같은 입력에 두 모델 응답을 1주일 비교 저장, 품질 차이 정량 측정. 이 3가지만 지키면 응답 형식이 바뀌어 클라이언트가 깨지는 사고는 대부분 막을 수 있어요. 한국 1인 개발자도 같은 패턴으로 안전하게 이동 가능합니다.
2026년 5월 19일 구글 I/O 2026에서 Gemini 3.5 Flash가 정식 출시(GA)됐어요. 발표 당일 바로 일반 사용 가능. 가격은 입력 100만 토큰당 $1.50, 출력 100만 토큰당 $9. 캐시 입력은 $0.15. 컨텍스트는 입력 1,048,576 토큰·출력 65,536 토큰, 1M 컨텍스트 표준 지원. 출력 속도가 289 tok/s로 다른 프런티어 모델 대비 약 4배 빠르고, Gemini 3 Flash 대비 70% 빠릅니다. Flash 티어인데 작년 Pro 모델(3.1 Pro)을 벤치마크에서 이기는 게 핵심 포인트예요.
Gemini 3.1 Pro는 $2/$12, Gemini 3.5 Flash는 $1.50/$9. 입력 25% 절감, 출력 25% 절감. 100만 토큰 입력 + 50만 토큰 출력 작업 기준 3.1 Pro는 $2 + $6 = $8, 3.5 Flash는 $1.50 + $4.50 = $6. 25% 절감이 그대로 적용돼요. 더 큰 절감은 GPT-5.5 대비예요. GPT-5.5는 입력·출력 단가가 3.5 Flash보다 높은 편이라 같은 작업을 옮기면 격차가 훨씬 크게 벌어집니다. 다만 GPT-5.5 요금은 개정이 잦으니 정확한 최신 단가는 OpenAI 공식 요금 페이지에서 확인하고, 본인의 월 토큰 사용량을 대입해 직접 계산하는 방법을 권해요.
Terminal-Bench 2.1에서 3.5 Flash 76.2% vs 3.1 Pro 70.3%(+5.9%p 우위), MCP Atlas 83.6%·GDPval-AA 1656 Elo·CharXiv 84.2%로 멀티모달도 우위. SWE-Bench Pro만 3.5 Flash 55.1% vs 3.1 Pro 54.2%로 거의 동급(0.9%p 차이, 오차 범위). 결론은 코딩 에이전트·터미널 작업·멀티모달은 3.5 Flash가 더 좋고, SWE 단독 작업은 동급. 가격은 25% 싸니까 무조건 3.5 Flash로 옮기는 게 본전이에요. 단 3.5 Pro(6월 출시 예정)이 나오면 다시 비교해야 합니다.
체감 차이가 큽니다. (1) 짧은 한국어 응답은 거의 기다림 없이 끝나요. (2) 긴 분석 답변도 다른 프런티어 모델보다 눈에 띄게 먼저 끝납니다. (3) 멀티 스텝 에이전트(MCP 호출 여러 단계)는 단계마다 대기가 쌓이는 구조라 속도 차이가 가장 크게 드러나요. 라이브 챗봇·실시간 데모·대량 배치 처리에서 응답성이 압도적이에요. 다만 복잡 추론(Math·Hard reasoning)은 속도가 정확도와 trade-off라 GPT-5.5·Opus 4.7이 안정적. 일상 작업 80%는 3.5 Flash가 본전, 복잡 20%는 외부 모델 분리가 정답.
Gemini API는 Google AI Studio에서 API 키 발급, 무료 티어로 일 1,500회 호출 + 분당 15회 제한. 유료 전환은 GCP 결제 계정 연결. 카드는 트래블월렛·하나 비바페이로 환차익 약 1% 절감. 한국 사업자는 GCP에 사업자 등록증·세금계산서 요청 가능, 부가세 환급 활용. 주의 — Google AI Studio 무료 티어는 데이터가 학습에 사용될 수 있어서 민감 데이터·고객 정보는 유료 API + Vertex AI로 분리하는 게 안전해요. 1인 개발자 추천 — 개발·테스트는 AI Studio 무료, 프로덕션은 유료 Vertex AI.
Gemini API는 동일 prefix가 자동 캐시되며 캐시 적중 시 입력 비용이 $1.50 → $0.15(90% 절감). 활용 패턴 3가지. (1) 시스템 프롬프트 길게 — 2,000~5,000토큰 시스템 프롬프트를 길게 작성 + 변하지 않는 컨텍스트를 앞쪽 배치. (2) 사용자 질문은 뒤쪽 — 자주 바뀌는 부분(사용자 입력)은 프롬프트 마지막. (3) 세션 5분 유지 — 캐시 TTL 5분이라 같은 사용자 세션 안에서는 적중률 높음. 챗봇 운영 시 캐시 적중률 70~85%까지 끌어올리면 실질 비용이 $1.50 → 약 $0.50까지 떨어져요. 월 1억 토큰 입력 기준 약 $100 → $30로 70% 절감.
(1) Google AI Studio — 개인 개발·실험·MVP용. 무료 티어 일 1,500회, 빠른 시작, 데이터가 학습에 사용될 수 있음. API 키 1개로 즉시 사용. (2) Vertex AI — 프로덕션·엔터프라이즈용. GCP 프로젝트 안에서 IAM·VPC·감사 로그 통합, 데이터 학습 사용 안 함, 한국 리전(asia-northeast3 서울) 지원, 세금계산서 발행. 단가는 동일($1.50/$9). 한국 1인 개발자 추천 흐름은 (1) 개발 단계는 AI Studio 무료 → (2) 트래픽 발생 시 Vertex AI 마이그레이션 → (3) 사업자 등록 후 세금계산서 + 부가세 환급. 처음부터 Vertex AI는 IAM 설정이 복잡하니까 비추.