AI 디지털교과서 — 교과용 도서에서 빠진 자리와 교육 자료로 고를 때 붙는 두 요건
「초ㆍ중등교육법」 전문을 직접 받아 읽었어요. AI 디지털교과서를 조문이 부르는 이름은 학습지원 소프트웨어이고, 제29조 제2항 단서가 교과용 도서에서 빼낸 뒤 제29조의2가 교육 자료 쪽에 놓아요. 붙는 요건은 둘이에요.
AI 기술을 누구나 쉽게 활용할 수 있도록 실전 가이드를 작성합니다. ChatGPT, Claude, AI 자동화, SEO 분야를 전문으로 다룹니다.
GPT-5.5 나오자마자 'Gemini는 끝났다'는 소문 있었죠?
저도 그 분위기였거든요. 그래서 Gemini 3.1 Pro 출시 직후부터 6주 동안 GPT-5.5·Claude Opus 4.7과 같은 작업을 던져봤어요. 결론은 Gemini가 압도하는 영역이 분명히 있고, 멀티모달·과학·새 논리 퍼즐에서 여전히 1등이에요.
오늘은 그 6주 데이터를 7가지 차이점으로 정리할게요. 2026년 5월 기준 ARC-AGI-2·GPQA Diamond·1M 컨텍스트 회수율·한국어 성능까지 같이 다룰게요.
ARC-AGI-2는 학습 데이터에 없는 새 논리 패턴 푸는 능력 평가.
이 벤치마크의 특징은 사람은 비교적 쉽게 푸는 문제를 모델은 크게 어려워한다는 점이에요. 사람과 모델의 격차가 아직 뚜렷하고, 세대가 올라갈 때마다 점수가 크게 뛰는 구간이라 모델 간 순위도 자주 바뀌어요. 그래서 특정 숫자를 외우기보다 공식 발표 자료에서 최신 리더보드를 직접 확인하는 편이 정확해요.
직접 던져본 테스트는 이런 식이에요. "그림 8장이 패턴 따라 배열돼 있어요. 9번째 그림 추론." 이런 유형에서 Gemini 3.1 Pro가 상대적으로 잘 버텼어요.
즉 새 도메인·처음 보는 작업에 Gemini가 강해요. 반대로 코딩·글쓰기 같은 학습 데이터 풍부 영역은 GPT-5.5·Claude Opus 4.7이 여전히 우위 많음.

박사 수준 물리·화학·생물 198문제로 구성된 벤치마크예요.
난이도 기준선:
이 기준선만 봐도 문제 성격이 드러나요. 검색으로는 못 풀고, 전공자도 절반 넘게 틀리는 문제라는 뜻이거든요. 최신 모델들은 이 구간에서 점수가 빠르게 오르는 중이라 모델별 순위는 발표마다 바뀌니, 구체 점수는 공식 자료로 확인하세요.
직접 테스트한 케이스: 양자역학 슈뢰딩거 방정식 변형 문제 → Gemini가 풀이 과정까지 명확하게 제시. 유기화학 반응 메커니즘 → Gemini와 Claude가 안정적.
의대·과학 연구·논문 분석 용도엔 Gemini 3.1 Pro가 1순위 후보예요. 다만 일반 코딩·문서 작성은 다른 모델이 빠를 수 있어요.
1M 토큰 입력은 경쟁 모델도 지원해요. 진짜 차이는 회수율, 즉 긴 문서 안에서 특정 정보를 정확히 찾아내는 능력에서 갈려요.
needle-in-haystack 방식으로 넣어 보면 세 모델 모두 짧은 문서에서는 비슷하게 잘 찾아요. 격차는 입력이 수십만 토큰을 넘어가고 비슷한 내용이 여러 번 반복될 때 벌어져요. 이 구간에서 Gemini 3.1 Pro가 상대적으로 안정적이었어요.
특히 멀티모달 1M 입력(텍스트+이미지+비디오 섞임)에서 체감 격차가 더 커져요. Gemini가 처음부터 멀티모달 통합 학습으로 만들어진 모델이라 그래요. 다만 자료 종류와 질문 방식에 따라 결과가 달라지니, 본인이 자주 다루는 문서로 한 번 재현해 보는 게 정확해요.
활용 예시: 책 8권 PDF + 영상 10시간 transcript → "X 개념이 등장하는 모든 위치 찾아줘" 같은 작업은 Gemini가 정답.
Gemini의 가장 큰 차별점. 1시간짜리 영상에 코드 화면 + 음성 설명 + 다이어그램 다 들어 있을 때:
[영상 업로드 + 텍스트 프롬프트]
이 영상은 React 강의예요.
- 강사가 설명한 컴포넌트 구조 markdown으로 정리
- 코드 화면에 나온 버그 식별
- 14:32~18:45 구간의 다이어그램을 텍스트로 풀어 설명
- 강의 끝에 추천한 라이브러리 5개 목록
Gemini는 한 번에 처리. GPT-5.5·Claude Opus 4.7은 영상 직접 입력 미지원이라 transcript + 스크린샷 따로 추출해서 넣어야 해요.
Claude vs Gemini vs ChatGPT 3주 실사용 비교에서 자세한 모달리티 지원 매트릭스 정리했어요.
Google이 동시에 출시한 Antigravity IDE에 3.1 Pro 기본 통합. 핵심 기능:
직접 테스트: 5,000줄 규모 React 프로젝트의 클래스 컴포넌트를 함수 컴포넌트와 훅으로 마이그레이션해 봤어요. 세 도구 모두 한 번에 끝내지는 못했고, 남는 수정량과 걸린 시간에서 차이가 났어요. Gemini는 빠른 대신 잔손질이 조금 더 필요했고, Claude Code는 느린 대신 결과가 깔끔한 쪽이었어요.
코딩 절대 성능은 Claude가 앞선다는 평이 많지만 속도와 비용을 함께 놓고 보면 Gemini 쪽이 ROI에서 유리한 구간이 있어요. 다만 모델별 단가는 자주 바뀌니, 배치 작업처럼 호출량이 큰 워크로드라면 각 사의 공식 가격 페이지에서 현재 단가를 직접 대조해 계산하세요.
주목할 점은 성능이 올라가는 동안 단가가 크게 뛰지 않았다는 거예요. 모델별 단가는 수시로 조정되니 아래 표는 상대적인 위치만 참고하고, 실제 금액은 공식 가격 페이지에서 확인하세요.
| 모델 | input 단가 | output 단가 | 1M 컨텍스트 |
|---|---|---|---|
| Gemini 3.1 Pro | 중간 | 중간 | ✓ |
| GPT-5.5 | 낮은 편 | 중간 | ✓ |
| Claude Opus 4.7 | 높은 편 | 높은 편 | ✓ |
| GPT-5.5 Pro | 가장 높음 | 가장 높음 | ✓ |
입력 단가만 보면 더 저렴한 선택지도 있지만, 실제 청구액은 응답 길이까지 곱해져서 결정돼요. 그래서 대량 처리·배치 분석 워크로드라면 본인 평균 입출력 토큰을 공식 단가표에 직접 대입해 보는 것이 가장 정확해요. 표만 보고 고르면 실제 청구서에서 순위가 뒤집히는 경우가 흔해요.
같은 한국어 작업을 세 모델에 나란히 던져 본 체감을 등급으로 정리하면 이래요. 점수가 아니라 상대 비교라는 점을 감안해 주세요.
| 작업 | GPT-5.5 | Claude Opus 4.7 | Gemini 3.1 Pro |
|---|---|---|---|
| 일상 대화 자연스러움 | 우수 | 우수 | 보통 |
| 블로그·SNS 톤 | 우수 | 우수 | 보통 |
| 학술 논문 요약 | 보통 | 우수 | 우수 |
| 법률 문서 분석 | 보통 | 우수 | 우수 |
| 한국어 코드 주석 | 우수 | 우수 | 우수 |
일상은 ChatGPT, 문학적 글은 Claude, 학술·과학은 Gemini. 한국 사용자는 작업에 따라 골라 쓰는 게 답.

6주 동안 7개 직군 친구·동료들과 같이 써본 결과 정리.
1순위: Gemini 3.1 Pro
1순위: Claude Opus 4.7 + 보조 Gemini 3.1 Pro
1순위: Gemini 3.1 Pro
1순위: GPT-5.5 + 보조 Claude
1순위: Gemini 3.1 Pro Vertex AI
1순위: Gemini App 유료 플랜
1순위: Claude Opus 4.7 메인 + Gemini 3.1 Pro 비용 절감 보조
엔터프라이즈 사용자는 직접 호출보다 Vertex AI 우회 권장.
금액을 그대로 옮겨 적는 건 의미가 없어요. 단가는 수시로 바뀌고, 같은 호출 수라도 프롬프트 길이와 응답 길이에 따라 청구서가 몇 배씩 벌어지거든요. 대신 본인 사용량을 어떻게 추정하고 어떤 결제 경로를 고르는지가 실제로 돈을 좌우해요.
계산 순서는 이래요. ① AI Studio나 Vertex AI 콘솔의 토큰 카운트 메트릭으로 최근 일주일 평균 입력·출력 토큰을 확인해요. ② 하루 호출 수를 곱해 월 입력·출력 토큰을 냅니다. ③ 그 두 숫자를 공식 가격 페이지의 input·output 단가에 각각 대입해요. 입력과 출력 단가는 보통 몇 배 차이가 나기 때문에 반드시 나눠서 곱해야 실제와 맞아요.
직접 6주 동안 정착시킨 일상 사용 패턴.
arXiv 새 논문 50편 RSS → Vertex AI에 일괄 입력 → "내 분야(LLM 정렬·강화학습)에 가장 중요한 5편 골라 한 줄 요약". 매일 8분 소요. 평소 1시간 직접 훑던 시간이 사라졌어요.
GitHub PR 생성 시 webhook → Gemini 3.1 Pro로 50K 토큰 컨텍스트(변경 파일 + 의존 파일 5개) 입력 → "보안 취약점·성능 회귀·코드 스타일 위반" 3개 영역 자동 코멘트. 평소 30분 리뷰가 5분.
유튜브 강의 1시간 영상 업로드 → "5분 단위 챕터 + 핵심 포인트 + 코드 화면 timestamp". 훑어보는 시간이 눈에 띄게 줄어요. 단 한국어 강의는 영문 강의보다 transcript 정확도가 낮게 느껴지는 편이라, 고유명사나 전문 용어는 결과를 한 번 훑어보고 고쳐야 해요.
한국어 고객 문의 → Gemini로 의도 분류 + 영어/일본어/중국어 동시 번역 → 1차 자동 답변 초안 → 사람이 검수 후 발송. 응답 시간 평소 4시간 → 30분.
Google Meet 녹음 1시간 → Gemini 멀티모달(음성 + 화면 공유 슬라이드) 동시 입력 → 결정사항·액션 아이템·담당자 자동 추출. 회의 후 5분 안에 슬랙 공유 가능.
경쟁사 블로그 100편 일괄 입력 → "주제 클러스터 + 누락된 키워드 + 백링크 패턴" 분석. 1M 컨텍스트로 한 번에 처리. 평소 SEMrush 도구 5만원 결제 + 분석 4시간이 5분.
Notion·Obsidian 노트 5,000개 → Vertex AI 컨텍스트 캐시에 적재 → 자연어 질문. RAG 인덱싱 안 해도 1M 컨텍스트가 RAG 대체. 정확도는 잘 만든 RAG와 비슷, 셋업 시간 0.
일상 대화의 자연스러움은 ChatGPT가, 문학적인 문장은 Claude가 강한 편이에요. Gemini는 학술 번역 쪽에 특화돼 있어요. 일반 비즈니스 메일이나 블로그 한국어라면 ChatGPT를 권해요.
Google AI Studio는 무료 사용 구간이 있지만 모델별로 분당·일일 호출 한도가 걸려 있어요. 한도 수치는 모델과 시점에 따라 자주 바뀌니 AI Studio 화면과 공식 문서에서 현재 값을 확인하세요. 학습이나 실험 정도는 무료로 충분하고, 본격적인 사용은 유료 플랜이나 API 결제가 필요해요.
네. Gemini 앱 설치 후 기본 어시스턴트로 설정. "Hey Google, Gemini" 호출. 안드로이드 14+ 권장.
표준어 발음이라면 Gemini 음성 인식으로 충분하다는 느낌이었어요. 사투리나 빠른 발화가 섞이면 ChatGPT 쪽이 더 잘 받아 적는 편이고요. 공식적으로 공개된 언어별 인식 정확도 수치는 따로 없으니, 본인 목소리와 자주 쓰는 용어로 같은 문장을 몇 번 읽어 보고 비교하는 게 가장 확실해요.
학생 요금제는 국가별로 제공 여부와 할인 폭이 달라서, 한국 계정에서는 안 뜨는 경우가 있어요. 결제 화면에 학생 옵션이 보이는지 직접 확인하는 수밖에 없어요. 대신 GCP 신규 가입 크레딧으로 Vertex AI를 일정 기간 무료로 써볼 수 있으니, 학생이라면 이 경로가 더 실용적일 때가 많아요.
NotebookLM도 Gemini 계열 모델 기반이지만, 노트북당 올릴 수 있는 소스 개수 한도가 따로 걸려 있어요. 한도는 요금제와 시점에 따라 바뀌니 NotebookLM 도움말에서 현재 값을 확인하세요. 자료를 모아 두고 질문하는 학습·연구용에는 NotebookLM UI가 편하고, 코드나 자동화에 물리려면 API 직접 호출이 맞아요.
GCP·Vertex AI는 한국 카드 정상 지원. 단 Gemini App Pro 직접 결제는 미국·EU 카드 우선이라 한국 카드 거부 케이스 있음. 우회: Google Play 한국 계정으로 인앱 결제 또는 GCP Marketplace 경유.
오늘 당장 할 수 있는 5가지:
Gemini 3.1 Pro는 만능은 아니지만 멀티모달·과학·새 논리·1M 회수율에서 명확히 1등이에요. GPT-5.2 vs GPT-5.5 차이 7가지도 같이 보면 본인 작업에 맞는 모델 결정에 도움 됩니다.
정확한 출시 시점과 API 단가는 Google 공식 가격 페이지에서 확인하는 게 정확해요. 요금은 모델과 시점에 따라 조정되기 때문에 기사나 블로그 숫자를 그대로 믿으면 안 돼요. 사용 경로는 Google AI Studio·Vertex AI·Gemini App·NotebookLM·Gemini CLI·Android Studio예요. 일반 사용자는 Gemini App 유료 플랜으로, 개발자는 API 키로 접근하는 구조라고 보면 돼요.
ARC-AGI-2는 학습 데이터에 없는 완전 새 논리 패턴을 푸는 능력을 측정하는 벤치마크예요. 사람은 비교적 쉽게 푸는데 모델은 크게 어려워하는 유형이라, 여기서 점수가 오르면 '외운 답'이 아니라 추론으로 푼다는 신호로 읽혀요. Gemini 3.1 Pro는 이 영역에서 강점을 보이는 편이에요. 다만 벤치마크 점수는 발표 주체와 측정 조건에 따라 달라지니 공식 발표 자료를 직접 확인하세요. 일상 코딩·글쓰기처럼 학습 데이터가 풍부한 영역은 경쟁 모델이 앞서는 케이스도 많아요.
GPQA Diamond는 박사급 과학(물리·화학·생물) 198문제로 구성된 벤치마크예요. 해당 분야 전문가 정답률이 65%, 검색을 허용한 비전문가가 34% 수준일 만큼 어려운 문제라, 여기서 높은 점수가 나오면 깊은 과학 추론이 된다는 뜻으로 읽혀요. Gemini 3.1 Pro는 양자역학·유기화학처럼 추론 단계가 긴 영역에서 강세를 보이는 편이에요. 모델별 점수는 발표 시점마다 바뀌니 공식 자료로 확인하세요. 과학 연구·논문 분석 용도라면 후보로 올릴 만해요.
입력 한도가 같아도 실제 정보 회수율(needle in haystack)은 모델마다 달라요. 긴 문서 안에서 특정 정보를 정확히 찾아내는 능력이 여기서 갈리는데, Gemini 3.1 Pro는 회수 정확도가 안정적인 편이에요. 특히 멀티모달(텍스트+이미지+비디오) 동시 입력에서 체감 격차가 커져요. 책 여러 권과 장시간 영상을 한 번에 넣고 훑는 작업이라면 Gemini가 잘 맞아요. 다만 체감은 문서 종류와 질문 방식에 따라 달라지니 본인 자료로 직접 테스트해 보세요.
한국어는 작업 종류에 따라 갈려요. 일상 대화나 SNS 톤처럼 자연스러운 구어체는 ChatGPT가 매끄럽다는 평이 많고, 학술 논문이나 보고서 요약처럼 정확도가 중요한 문서는 Gemini가 안정적인 편이에요. 다만 이런 체감은 프롬프트와 주제에 따라 뒤집히기도 해서, 본인이 자주 쓰는 문서 유형으로 같은 질문을 던져 비교해 보는 게 가장 확실해요.
엔터프라이즈는 Vertex AI 권장. ① 데이터 학습 안 함 ② SOC 2 Type II + HIPAA + ISO 27001 ③ Customer-Managed Encryption Keys ④ VPC Service Controls 통합. 한국 사용자는 asia-northeast3(서울) 리전으로 데이터 국내 처리 가능. 직접 Gemini App으로 쓸 땐 데이터가 학습에 쓰일 수 있어 민감 업무는 Vertex 필수.
직접 6주 데이터: ① 멀티모달 분석(영상+코드+텍스트 동시) ② 학술 논문 요약·분석 ③ 새로운 논리 퍼즐(ARC 류) ④ 긴 코드베이스 리팩터링(repo 전체) ⑤ 동영상 시간대별 액션 분석. 약점: ① 한국어 일상 대화 ② 창작 글쓰기 톤 ③ 단순 코드 자동완성(Cursor·Copilot 우위).