HowtoAI
ai-guide2026-05-11 5 min read

Gemini 3.1 Pro 신규 기능 7가지 — 멀티모달·과학 추론·1M 컨텍스트 어디서 진짜 다른가 2026

🤖
HowtoAI 편집팀AI 전문 에디터

AI 기술을 누구나 쉽게 활용할 수 있도록 실전 가이드를 작성합니다. ChatGPT, Claude, AI 자동화, SEO 분야를 전문으로 다룹니다.

📅 2026-05-11⏱️ 5 min read🌐 how-toai.com
목차 보기

GPT-5.5 나오자마자 'Gemini는 끝났다'는 소문 있었죠?

저도 그 분위기였거든요. 그래서 Gemini 3.1 Pro 출시 직후부터 6주 동안 GPT-5.5·Claude Opus 4.7과 같은 작업을 던져봤어요. 결론은 Gemini가 압도하는 영역이 분명히 있고, 멀티모달·과학·새 논리 퍼즐에서 여전히 1등이에요.

오늘은 그 6주 데이터를 7가지 차이점으로 정리할게요. 2026년 5월 기준 ARC-AGI-2·GPQA Diamond·1M 컨텍스트 회수율·한국어 성능까지 같이 다룰게요.

1. ARC-AGI-2 — 본 적 없는 문제 푸는 능력

ARC-AGI-2는 학습 데이터에 없는 새 논리 패턴 푸는 능력 평가.

이 벤치마크의 특징은 사람은 비교적 쉽게 푸는 문제를 모델은 크게 어려워한다는 점이에요. 사람과 모델의 격차가 아직 뚜렷하고, 세대가 올라갈 때마다 점수가 크게 뛰는 구간이라 모델 간 순위도 자주 바뀌어요. 그래서 특정 숫자를 외우기보다 공식 발표 자료에서 최신 리더보드를 직접 확인하는 편이 정확해요.

직접 던져본 테스트는 이런 식이에요. "그림 8장이 패턴 따라 배열돼 있어요. 9번째 그림 추론." 이런 유형에서 Gemini 3.1 Pro가 상대적으로 잘 버텼어요.

새 도메인·처음 보는 작업에 Gemini가 강해요. 반대로 코딩·글쓰기 같은 학습 데이터 풍부 영역은 GPT-5.5·Claude Opus 4.7이 여전히 우위 많음.

Gemini 3.1 Pro 신규 기능 분석 — 신경망 추론 모델 시각화

2. GPQA Diamond — 박사급 과학 문제

박사 수준 물리·화학·생물 198문제로 구성된 벤치마크예요.

난이도 기준선:

  • 비전문가 정답률: 34%(검색 허용 조건)
  • 해당 분야 인간 전문가: 65%

이 기준선만 봐도 문제 성격이 드러나요. 검색으로는 못 풀고, 전공자도 절반 넘게 틀리는 문제라는 뜻이거든요. 최신 모델들은 이 구간에서 점수가 빠르게 오르는 중이라 모델별 순위는 발표마다 바뀌니, 구체 점수는 공식 자료로 확인하세요.

직접 테스트한 케이스: 양자역학 슈뢰딩거 방정식 변형 문제 → Gemini가 풀이 과정까지 명확하게 제시. 유기화학 반응 메커니즘 → Gemini와 Claude가 안정적.

의대·과학 연구·논문 분석 용도엔 Gemini 3.1 Pro가 1순위 후보예요. 다만 일반 코딩·문서 작성은 다른 모델이 빠를 수 있어요.

3. 1M 컨텍스트 회수율 — 정보 정확히 찾기

1M 토큰 입력은 경쟁 모델도 지원해요. 진짜 차이는 회수율, 즉 긴 문서 안에서 특정 정보를 정확히 찾아내는 능력에서 갈려요.

needle-in-haystack 방식으로 넣어 보면 세 모델 모두 짧은 문서에서는 비슷하게 잘 찾아요. 격차는 입력이 수십만 토큰을 넘어가고 비슷한 내용이 여러 번 반복될 때 벌어져요. 이 구간에서 Gemini 3.1 Pro가 상대적으로 안정적이었어요.

특히 멀티모달 1M 입력(텍스트+이미지+비디오 섞임)에서 체감 격차가 더 커져요. Gemini가 처음부터 멀티모달 통합 학습으로 만들어진 모델이라 그래요. 다만 자료 종류와 질문 방식에 따라 결과가 달라지니, 본인이 자주 다루는 문서로 한 번 재현해 보는 게 정확해요.

활용 예시: 책 8권 PDF + 영상 10시간 transcript → "X 개념이 등장하는 모든 위치 찾아줘" 같은 작업은 Gemini가 정답.

4. 멀티모달 — 영상+코드+이미지 동시 처리

Gemini의 가장 큰 차별점. 1시간짜리 영상에 코드 화면 + 음성 설명 + 다이어그램 다 들어 있을 때:

[영상 업로드 + 텍스트 프롬프트]
이 영상은 React 강의예요. 
- 강사가 설명한 컴포넌트 구조 markdown으로 정리
- 코드 화면에 나온 버그 식별
- 14:32~18:45 구간의 다이어그램을 텍스트로 풀어 설명
- 강의 끝에 추천한 라이브러리 5개 목록

Gemini는 한 번에 처리. GPT-5.5·Claude Opus 4.7은 영상 직접 입력 미지원이라 transcript + 스크린샷 따로 추출해서 넣어야 해요.

Claude vs Gemini vs ChatGPT 3주 실사용 비교에서 자세한 모달리티 지원 매트릭스 정리했어요.

5. 에이전틱 코딩 — Antigravity·Vertex 통합

Google이 동시에 출시한 Antigravity IDE에 3.1 Pro 기본 통합. 핵심 기능:

  • 멀티 파일 리팩터링 (50개 파일 동시)
  • 테스트 자동 작성·실행
  • Git PR 자동 생성

직접 테스트: 5,000줄 규모 React 프로젝트의 클래스 컴포넌트를 함수 컴포넌트와 훅으로 마이그레이션해 봤어요. 세 도구 모두 한 번에 끝내지는 못했고, 남는 수정량과 걸린 시간에서 차이가 났어요. Gemini는 빠른 대신 잔손질이 조금 더 필요했고, Claude Code는 느린 대신 결과가 깔끔한 쪽이었어요.

코딩 절대 성능은 Claude가 앞선다는 평이 많지만 속도와 비용을 함께 놓고 보면 Gemini 쪽이 ROI에서 유리한 구간이 있어요. 다만 모델별 단가는 자주 바뀌니, 배치 작업처럼 호출량이 큰 워크로드라면 각 사의 공식 가격 페이지에서 현재 단가를 직접 대조해 계산하세요.

6. 가격 — 세대가 올라도 단가는 크게 안 올랐다

주목할 점은 성능이 올라가는 동안 단가가 크게 뛰지 않았다는 거예요. 모델별 단가는 수시로 조정되니 아래 표는 상대적인 위치만 참고하고, 실제 금액은 공식 가격 페이지에서 확인하세요.

모델input 단가output 단가1M 컨텍스트
Gemini 3.1 Pro중간중간
GPT-5.5낮은 편중간
Claude Opus 4.7높은 편높은 편
GPT-5.5 Pro가장 높음가장 높음

입력 단가만 보면 더 저렴한 선택지도 있지만, 실제 청구액은 응답 길이까지 곱해져서 결정돼요. 그래서 대량 처리·배치 분석 워크로드라면 본인 평균 입출력 토큰을 공식 단가표에 직접 대입해 보는 것이 가장 정확해요. 표만 보고 고르면 실제 청구서에서 순위가 뒤집히는 경우가 흔해요.

7. 한국어 성능 — 학술은 강하고 일상은 약함

같은 한국어 작업을 세 모델에 나란히 던져 본 체감을 등급으로 정리하면 이래요. 점수가 아니라 상대 비교라는 점을 감안해 주세요.

작업GPT-5.5Claude Opus 4.7Gemini 3.1 Pro
일상 대화 자연스러움우수우수보통
블로그·SNS 톤우수우수보통
학술 논문 요약보통우수우수
법률 문서 분석보통우수우수
한국어 코드 주석우수우수우수

일상은 ChatGPT, 문학적 글은 Claude, 학술·과학은 Gemini. 한국 사용자는 작업에 따라 골라 쓰는 게 답.

Gemini 3.1 Pro 데이터 분석 대시보드 — 멀티모달 입력 처리

6주 직접 써본 함정 5가지

  1. Gemini App 무료 vs 유료 차이 — 무료 플랜은 기본이 Flash 계열이고 상위 모델은 사용 횟수가 제한돼요. 한도는 시점마다 바뀌니 앱 안내 화면에서 확인하세요. 매일 쓰는 작업이라면 유료 플랜이 편해요.
  2. 데이터 학습 옵트아웃 — Gemini App 기본은 학습 ON. 설정 → Activity & Privacy에서 OFF. Vertex AI는 기본 OFF.
  3. API 응답 일관성 — Temperature 0이라도 같은 입력에 응답 다를 때 있음. 결정론 필요한 워크플로는 시드 고정 필수.
  4. 이미지 생성은 별도 모델 — Gemini 3.1 Pro는 텍스트·코드 분석 모델. 이미지 생성은 Imagen 4 별도 호출.
  5. Antigravity IDE 베타 — 출시 직후 안정성 이슈. VS Code·Cursor 익숙한 사용자는 굳이 안 옮겨도 됨. API 통합으로 Cursor에서 Gemini 3.1 Pro 호출 가능.

사용자 직군별 추천 — 본인 작업이 어디 속하는지

6주 동안 7개 직군 친구·동료들과 같이 써본 결과 정리.

학술 연구자·박사 과정

1순위: Gemini 3.1 Pro

  • 논문 50편 메타 분석은 1M 컨텍스트와 안정적인 회수 정확도로 압도
  • GPQA 계열 과학 추론에 강해 박사급 질문에서 신뢰도가 높은 편
  • 단점: 한국어 학술 자료 인용 시 영문 번역체 응답 → 자체 윤문 필요
  • 비용: 논문 한 편 분석은 단가상 부담이 큰 편은 아니에요. 월 논문 편수 × 평균 입출력 토큰으로 미리 계산해 두세요

풀스택·프론트 개발자

1순위: Claude Opus 4.7 + 보조 Gemini 3.1 Pro

  • 매일 하는 코딩은 Claude가 우위
  • 50만 줄 모놀리스 분석·리팩터링은 Gemini 1M 컨텍스트로 위임
  • Gemini 3.1 Pro 가격 우위로 배치 분석·테스트 자동 생성에 주로 활용
  • 비용 분배: 대화형 코딩은 정액 구독으로, 배치 호출은 종량제 API로 나누면 예측이 쉬워져요

데이터 분석가·BI 엔지니어

1순위: Gemini 3.1 Pro

  • 멀티모달(차트 이미지 + 원본 CSV + SQL 쿼리) 동시 입력 우위
  • Vertex AI BigQuery 직접 통합으로 RAG 없이 테이블 1억 행 쿼리 가능
  • Looker Studio 그래프 → Gemini로 자연어 해석 자동화
  • 비용: 차트 이미지가 섞이면 입력 토큰이 텍스트만 넣을 때보다 크게 늘어요. 이미지 해상도를 필요한 만큼만 올리는 게 절감 포인트예요

콘텐츠 크리에이터·블로거

1순위: GPT-5.5 + 보조 Claude

  • 일상 한국어·SNS 톤은 ChatGPT 압도
  • 긴 문학적 글·소설 톤은 Claude
  • Gemini는 영상 분석(유튜브 transcript + 썸네일 분석) 한정 활용
  • 비용: 이 직군은 API보다 각 사 개인 구독 플랜 조합이 보통 유리해요. 현재 구독료는 각 서비스 요금 페이지에서 확인하세요

변호사·세무사·회계사

1순위: Gemini 3.1 Pro Vertex AI

  • 한국어 법률 문서 분석에서 결과가 가장 안정적인 편
  • Vertex AI 데이터 비학습 보장 + asia-northeast3(서울) 리전
  • 1M 컨텍스트로 계약서 50건 일괄 검토 가능
  • 비용: Vertex AI 종량제라 검토 건수에 비례해요. 보안 옵션(CMEK·VPC SC)은 별도 과금 항목이 붙는지 견적 단계에서 확인하세요

대학생·자격증 준비생

1순위: Gemini App 유료 플랜

  • ARC-AGI 계열이 강해 새 유형 문제(수능·LEET·PSAT) 추론에 우위
  • 무료 플랜은 상위 모델 사용 횟수가 제한 → 매일 쓰는 학습이라면 유료 플랜 권장
  • 한국 학원 교재 PDF 업로드 + 풀이 요청 가능
  • 비용: 월 구독료와 학생 요금 적용 여부는 국가별로 달라요. 결제 화면에서 본인 계정에 뜨는 금액을 확인하세요

1인 SaaS·솔로 개발자

1순위: Claude Opus 4.7 메인 + Gemini 3.1 Pro 비용 절감 보조

  • 새 기능 개발은 Claude
  • 대량 배치 처리(이메일 자동 응답·로그 분석)는 Gemini 가격 우위
  • Antigravity IDE는 안정화 전까지는 Cursor + Claude Code 유지
  • 비용: 개발 시간 대부분을 차지하는 도구만 상위 정액제로 두고, 나머지는 종량제로 붙이는 구조가 낭비가 적어요

Vertex AI Korea 리전 셋업 — 한국 기업 필수

엔터프라이즈 사용자는 직접 호출보다 Vertex AI 우회 권장.

1단계: GCP 프로젝트 생성

  • console.cloud.google.com 가입
  • 신규 가입 시 $300 크레딧 (90일 만료)
  • Vertex AI API 활성화

2단계: 서울 리전 선택

  • Region: asia-northeast3 (서울)
  • 데이터 처리·저장 모두 국내 보장
  • HIPAA·SOC 2·PCI DSS 인증 적용
  • 한국 개인정보보호법 준수 명시

3단계: Customer-Managed Encryption Keys 활성화

  • Cloud KMS에서 자체 키 생성
  • Vertex AI 모델 호출 시 자체 키로 암호화
  • Google도 데이터 복호화 불가
  • 키 회전 30일·90일 자동 정책

4단계: VPC Service Controls 통합

  • 사내 VPC 안에서만 Vertex AI 호출 허용
  • 외부 IP 호출 시 차단
  • 보안 감사 로그 Cloud Logging 자동 적재
  • BigQuery·Cloud Storage와 동일 보안 perimeter

5단계: 사용량 알림 설정

  • Budget Alert: 월 $500·$1,000·$2,000 단계 알림
  • 토큰 카운트 메트릭 Cloud Monitoring 대시보드
  • 비정상 호출 패턴(시간당 1만 호출 초과) 자동 차단 룰

사용량 구간별 결제 방식 — 내 청구서 직접 계산하기

금액을 그대로 옮겨 적는 건 의미가 없어요. 단가는 수시로 바뀌고, 같은 호출 수라도 프롬프트 길이와 응답 길이에 따라 청구서가 몇 배씩 벌어지거든요. 대신 본인 사용량을 어떻게 추정하고 어떤 결제 경로를 고르는지가 실제로 돈을 좌우해요.

계산 순서는 이래요. ① AI Studio나 Vertex AI 콘솔의 토큰 카운트 메트릭으로 최근 일주일 평균 입력·출력 토큰을 확인해요. ② 하루 호출 수를 곱해 월 입력·출력 토큰을 냅니다. ③ 그 두 숫자를 공식 가격 페이지의 input·output 단가에 각각 대입해요. 입력과 출력 단가는 보통 몇 배 차이가 나기 때문에 반드시 나눠서 곱해야 실제와 맞아요.

가벼운 사용 (개인 학습·취미)

  • 일일 호출 20회 안팎·짧은 프롬프트 위주
  • API 결제보다 Gemini App 유료 플랜 하나가 대개 저렴하고 관리도 편해요
  • 코드에서 호출할 일이 없다면 API 키는 아예 안 만들어도 돼요

중간 사용 (1인 개발자·블로거)

  • 일일 호출 100회 안팎·문서 단위 입력이 섞임
  • Vertex AI 직접 결제 + Budget Alert 조합을 권해요. 한 달에 감당 가능한 상한을 미리 정해 두면 사고를 막아요
  • 반복되는 프롬프트가 있다면 컨텍스트 캐시로 입력 토큰을 줄이는 쪽이 단가 비교보다 효과가 커요

헤비 사용 (스타트업·SaaS 팀)

  • 일일 호출 1,000회 이상·배치 작업 포함
  • 이 구간부터는 모델 선택보다 출력 길이 통제가 비용을 결정해요. 응답 최대 토큰을 제한하고 요약 포맷을 고정하세요
  • 실시간이 아닌 작업은 배치·비동기 처리 경로가 있는지 공식 문서에서 확인해 볼 만해요

엔터프라이즈 (10명+ 팀)

  • 팀 단위 사용·감사 요건 동반
  • 영업 계약(Custom Pricing) 대상이라 공개 단가와 실제 계약가가 달라져요. 할인 폭은 사용량과 약정 기간에 따라 정해지니 세일즈 문의로 확인하세요
  • 부서별 프로젝트 분리와 라벨 기반 비용 배분을 처음부터 잡아 두는 편이 나중에 편해요

Gemini 3.1 Pro 6주 사용 실전 워크플로 7가지

직접 6주 동안 정착시킨 일상 사용 패턴.

워크플로 1 — 매일 아침 학술 뉴스 큐레이션

arXiv 새 논문 50편 RSS → Vertex AI에 일괄 입력 → "내 분야(LLM 정렬·강화학습)에 가장 중요한 5편 골라 한 줄 요약". 매일 8분 소요. 평소 1시간 직접 훑던 시간이 사라졌어요.

워크플로 2 — 코드 리뷰 자동화

GitHub PR 생성 시 webhook → Gemini 3.1 Pro로 50K 토큰 컨텍스트(변경 파일 + 의존 파일 5개) 입력 → "보안 취약점·성능 회귀·코드 스타일 위반" 3개 영역 자동 코멘트. 평소 30분 리뷰가 5분.

워크플로 3 — 영상 강의 인덱싱

유튜브 강의 1시간 영상 업로드 → "5분 단위 챕터 + 핵심 포인트 + 코드 화면 timestamp". 훑어보는 시간이 눈에 띄게 줄어요. 단 한국어 강의는 영문 강의보다 transcript 정확도가 낮게 느껴지는 편이라, 고유명사나 전문 용어는 결과를 한 번 훑어보고 고쳐야 해요.

워크플로 4 — 다국어 고객 지원 1차 응대

한국어 고객 문의 → Gemini로 의도 분류 + 영어/일본어/중국어 동시 번역 → 1차 자동 답변 초안 → 사람이 검수 후 발송. 응답 시간 평소 4시간 → 30분.

워크플로 5 — 회의록 자동 정리

Google Meet 녹음 1시간 → Gemini 멀티모달(음성 + 화면 공유 슬라이드) 동시 입력 → 결정사항·액션 아이템·담당자 자동 추출. 회의 후 5분 안에 슬랙 공유 가능.

워크플로 6 — SEO 콘텐츠 클러스터 분석

경쟁사 블로그 100편 일괄 입력 → "주제 클러스터 + 누락된 키워드 + 백링크 패턴" 분석. 1M 컨텍스트로 한 번에 처리. 평소 SEMrush 도구 5만원 결제 + 분석 4시간이 5분.

워크플로 7 — 개인 지식 관리 RAG 대체

Notion·Obsidian 노트 5,000개 → Vertex AI 컨텍스트 캐시에 적재 → 자연어 질문. RAG 인덱싱 안 해도 1M 컨텍스트가 RAG 대체. 정확도는 잘 만든 RAG와 비슷, 셋업 시간 0.

한국 사용자 자주 묻는 추가 질문 5가지

Q1. Gemini 3.1 Pro로 번역하면 한국어 자연스러워요?

일상 대화의 자연스러움은 ChatGPT가, 문학적인 문장은 Claude가 강한 편이에요. Gemini는 학술 번역 쪽에 특화돼 있어요. 일반 비즈니스 메일이나 블로그 한국어라면 ChatGPT를 권해요.

Q2. 무료로 쓸 수 있는 한도는?

Google AI Studio는 무료 사용 구간이 있지만 모델별로 분당·일일 호출 한도가 걸려 있어요. 한도 수치는 모델과 시점에 따라 자주 바뀌니 AI Studio 화면과 공식 문서에서 현재 값을 확인하세요. 학습이나 실험 정도는 무료로 충분하고, 본격적인 사용은 유료 플랜이나 API 결제가 필요해요.

Q3. 안드로이드폰에서 Gemini를 시리·빅스비처럼 쓸 수 있어요?

네. Gemini 앱 설치 후 기본 어시스턴트로 설정. "Hey Google, Gemini" 호출. 안드로이드 14+ 권장.

Q4. 한국어 음성 입력 정확도는?

표준어 발음이라면 Gemini 음성 인식으로 충분하다는 느낌이었어요. 사투리나 빠른 발화가 섞이면 ChatGPT 쪽이 더 잘 받아 적는 편이고요. 공식적으로 공개된 언어별 인식 정확도 수치는 따로 없으니, 본인 목소리와 자주 쓰는 용어로 같은 문장을 몇 번 읽어 보고 비교하는 게 가장 확실해요.

Q5. 학생 할인이나 무료 트라이얼 있나요?

학생 요금제는 국가별로 제공 여부와 할인 폭이 달라서, 한국 계정에서는 안 뜨는 경우가 있어요. 결제 화면에 학생 옵션이 보이는지 직접 확인하는 수밖에 없어요. 대신 GCP 신규 가입 크레딧으로 Vertex AI를 일정 기간 무료로 써볼 수 있으니, 학생이라면 이 경로가 더 실용적일 때가 많아요.

Q6. NotebookLM은 Gemini 3.1 Pro랑 같은 모델인가요?

NotebookLM도 Gemini 계열 모델 기반이지만, 노트북당 올릴 수 있는 소스 개수 한도가 따로 걸려 있어요. 한도는 요금제와 시점에 따라 바뀌니 NotebookLM 도움말에서 현재 값을 확인하세요. 자료를 모아 두고 질문하는 학습·연구용에는 NotebookLM UI가 편하고, 코드나 자동화에 물리려면 API 직접 호출이 맞아요.

Q7. 한국 카드로 결제 가능한가요?

GCP·Vertex AI는 한국 카드 정상 지원. 단 Gemini App Pro 직접 결제는 미국·EU 카드 우선이라 한국 카드 거부 케이스 있음. 우회: Google Play 한국 계정으로 인앱 결제 또는 GCP Marketplace 경유.

마무리 — 지금 5분 안에 시작

오늘 당장 할 수 있는 5가지:

  1. Google AI Studio 가입 — aistudio.google.com 무료, API 키 발급
  2. Gemini 3.1 Pro 직접 테스트 — 본인이 자주 하는 작업 5개 던져보기
  3. GPT-5.5 또는 Claude Opus 4.7와 1:1 비교 — 같은 입력에 응답 품질 측정
  4. 워크플로 분배 결정 — 일상 ChatGPT, 학술 Gemini, 깊은 코딩 Claude
  5. Vertex AI 서울 리전 셋업 — 엔터프라이즈는 데이터 국내 처리 필수

Gemini 3.1 Pro는 만능은 아니지만 멀티모달·과학·새 논리·1M 회수율에서 명확히 1등이에요. GPT-5.2 vs GPT-5.5 차이 7가지도 같이 보면 본인 작업에 맞는 모델 결정에 도움 됩니다.

❓ 자주 묻는 질문 (FAQ)

Gemini 3.1 Pro 출시일이랑 가격은요?

정확한 출시 시점과 API 단가는 Google 공식 가격 페이지에서 확인하는 게 정확해요. 요금은 모델과 시점에 따라 조정되기 때문에 기사나 블로그 숫자를 그대로 믿으면 안 돼요. 사용 경로는 Google AI Studio·Vertex AI·Gemini App·NotebookLM·Gemini CLI·Android Studio예요. 일반 사용자는 Gemini App 유료 플랜으로, 개발자는 API 키로 접근하는 구조라고 보면 돼요.

ARC-AGI-2 점수가 그렇게 대단한 거예요?

ARC-AGI-2는 학습 데이터에 없는 완전 새 논리 패턴을 푸는 능력을 측정하는 벤치마크예요. 사람은 비교적 쉽게 푸는데 모델은 크게 어려워하는 유형이라, 여기서 점수가 오르면 '외운 답'이 아니라 추론으로 푼다는 신호로 읽혀요. Gemini 3.1 Pro는 이 영역에서 강점을 보이는 편이에요. 다만 벤치마크 점수는 발표 주체와 측정 조건에 따라 달라지니 공식 발표 자료를 직접 확인하세요. 일상 코딩·글쓰기처럼 학습 데이터가 풍부한 영역은 경쟁 모델이 앞서는 케이스도 많아요.

GPQA Diamond 점수는 의미가 뭐예요?

GPQA Diamond는 박사급 과학(물리·화학·생물) 198문제로 구성된 벤치마크예요. 해당 분야 전문가 정답률이 65%, 검색을 허용한 비전문가가 34% 수준일 만큼 어려운 문제라, 여기서 높은 점수가 나오면 깊은 과학 추론이 된다는 뜻으로 읽혀요. Gemini 3.1 Pro는 양자역학·유기화학처럼 추론 단계가 긴 영역에서 강세를 보이는 편이에요. 모델별 점수는 발표 시점마다 바뀌니 공식 자료로 확인하세요. 과학 연구·논문 분석 용도라면 후보로 올릴 만해요.

1M 컨텍스트는 GPT-5.5·Claude Opus 4.7이랑 같은데 뭐가 달라요?

입력 한도가 같아도 실제 정보 회수율(needle in haystack)은 모델마다 달라요. 긴 문서 안에서 특정 정보를 정확히 찾아내는 능력이 여기서 갈리는데, Gemini 3.1 Pro는 회수 정확도가 안정적인 편이에요. 특히 멀티모달(텍스트+이미지+비디오) 동시 입력에서 체감 격차가 커져요. 책 여러 권과 장시간 영상을 한 번에 넣고 훑는 작업이라면 Gemini가 잘 맞아요. 다만 체감은 문서 종류와 질문 방식에 따라 달라지니 본인 자료로 직접 테스트해 보세요.

한국어 성능은 어때요?

한국어는 작업 종류에 따라 갈려요. 일상 대화나 SNS 톤처럼 자연스러운 구어체는 ChatGPT가 매끄럽다는 평이 많고, 학술 논문이나 보고서 요약처럼 정확도가 중요한 문서는 Gemini가 안정적인 편이에요. 다만 이런 체감은 프롬프트와 주제에 따라 뒤집히기도 해서, 본인이 자주 쓰는 문서 유형으로 같은 질문을 던져 비교해 보는 게 가장 확실해요.

Vertex AI에서 쓰면 뭐가 좋아요?

엔터프라이즈는 Vertex AI 권장. ① 데이터 학습 안 함 ② SOC 2 Type II + HIPAA + ISO 27001 ③ Customer-Managed Encryption Keys ④ VPC Service Controls 통합. 한국 사용자는 asia-northeast3(서울) 리전으로 데이터 국내 처리 가능. 직접 Gemini App으로 쓸 땐 데이터가 학습에 쓰일 수 있어 민감 업무는 Vertex 필수.

어떤 작업에 진짜 강한가요?

직접 6주 데이터: ① 멀티모달 분석(영상+코드+텍스트 동시) ② 학술 논문 요약·분석 ③ 새로운 논리 퍼즐(ARC 류) ④ 긴 코드베이스 리팩터링(repo 전체) ⑤ 동영상 시간대별 액션 분석. 약점: ① 한국어 일상 대화 ② 창작 글쓰기 톤 ③ 단순 코드 자동완성(Cursor·Copilot 우위).

📚 함께 읽으면 좋은 글 (Related Posts)

AI 사용법 가이드 더 보기 →
챗GPT 광고 설정 — 개인화를 꺼도 광고는 남고, 지운 광고 데이터는 30일 남는다
chatgpt-guide2026-08-18

챗GPT 광고 설정 — 개인화를 꺼도 광고는 남고, 지운 광고 데이터는 30일 남는다

챗GPT 광고 설정 화면에서 문서가 Ads controls 항목으로 열거하는 것은 네 줄이고, 광고를 없애는 플랜 전환은 같은 화면의 다섯 번째 줄이에요. 개인화를 꺼도 광고는 그대로 남고, 광고를 없애는 항목은 메시지 한도를 깎고, 지운 광고 데이터는 서버에서 빠지는 데 최대 30일이 걸려요. OpenAI 헬프센터 원문 문장으로 경계를 갈라 정리했어요.