- Gemini의 툴박스는 Canvas, Deep Research, Guided Learning과 같은 안정적인 도구와 실험적인 Labs 기능을 결합합니다.
- Gemini API를 사용하면 Google Workspace 및 사용자 지정 자동화 전반에 걸쳐 멀티모달 및 함수 호출 워크플로를 구현할 수 있습니다.
- 가이드 학습, Canvas 및 에이전트를 통해 Gemini는 개인 교사이자 문서, 슬라이드 및 이메일 작업을 도와주는 업무 보조 도구 역할을 모두 수행합니다.
- Labs, Gemini Enterprise 및 Workspace 통합을 사용하면 팀은 자체 데이터를 기반으로 강력한 AI를 안전하게 테스트할 수 있습니다.
"제미니 툴박스"는 더 이상 단순히 눈길을 끄는 문구가 아닙니다. 구글이 일상적인 학습부터 기업 워크플로에 이르기까지 모든 분야에 조용히 접목시키고 있는 실용적인 앱, 도구, 에이전트 및 API 모음입니다. 제미니는 이제 하나의 거대한 도우미가 아니라, 각 기능이 특정 도구 역할을 하는 툴박스와 같습니다. 검색 엔진, 튜터, 코드 도우미, 회의 일정 관리 도구, 슬라이드 제작 도구 등 다양한 기능을 제공합니다.
Canvas, Guided Learning, Labs, 에이전트, Gemini Enterprise 및 Gemini API와 같은 구성 요소들이 어떻게 서로 연결되는지 이해한다면 Gemini를 단순한 신기한 챗봇이 아닌 실질적인 업무 도구로 활용할 수 있습니다. 아래에서는 이러한 도구 모음에 대한 자세한 안내를 제공합니다. 안정적인 "도구" 영역에 있는 기능, "랩"에서 테스트 중인 기능, 이미지와 비디오를 활용하여 Gemini가 튜터로서 작동하는 방식, 그리고 개발자가 API를 Google Workspace에 통합하여 본격적인 자동화를 구현하는 방법 등을 살펴보겠습니다.
오늘날 제미니의 툴박스에는 정확히 무엇이 들어 있을까요?
제미니는 다양한 프런트엔드(웹, 모바일 앱, 워크스페이스 통합 및 개발자 API)를 통해 제공되는 AI 모델 제품군( 언어 모델이란 무엇인가? )(제미니 1.0, 제미니 1.5, 제미니 3 등)으로 이해하는 것이 가장 좋습니다. "툴박스"라는 개념은 구글이 제미니 인터페이스, 특히 웹 환경에서 구체적인 기능들을 그룹화하는 방식에서 비롯되었습니다.
웹에서 Gemini의 주요 선택 도구는 크게 두 영역으로 나뉩니다. "Tools"는 안정적이고 바로 사용 가능한 기능을 위한 영역이고, "Labs"는 아직 개발 중인 실험적인 기능을 위한 영역입니다. "Tools"는 매일 사용하는 믿음직한 드라이버와 같고, "Labs"는 다음 주에 형태가 바뀔 수도 있는 프로토타입을 보관하는 트레이와 같습니다.
모바일용 Gemini 앱에도 이러한 도구들(가이드 학습, Canvas와 유사한 환경, 풍부한 이미지 도움말 등)이 많이 추가되고 있지만, 단계적으로 출시되고 있습니다. 앱에서 특정 기능이 아직 보이지 않는 경우, Google은 나중에 다시 시도하거나 gemini.google.com 에서 웹 버전의 최신 버전을 확인해 보라고 권장합니다.
내부적으로 이러한 모든 기능은 Gemini API를 기반으로 하며, 이 API는 멀티모달 모델과 함수 호출을 제공하여 코드를 통해 콘텐츠를 생성하고, 이미지를 분석하고, 워크플로를 구성할 수 있도록 합니다. 이 API는 나중에 다룰 Workspace 자동화 기능의 핵심 기반이 됩니다.
도구 vs 연구실: 제미니의 기능 구성 방식
Gemini에 버튼과 모드가 추가됨에 따라 Google은 "도구"와 "랩"이라는 두 섹션을 통해 완성된 기능과 실험적인 기능을 더욱 명확하게 구분했습니다. 이러한 변경 사항은 웹 인터페이스에서 이미 확인할 수 있으며 Google 서버에 순차적으로 배포되고 있으므로 모든 계정에서 동일한 레이아웃이 표시되는 것은 아닙니다.
'도구' 섹션은 구글이 일상적인 사용에 안정적이고 예측 가능하다고 판단하는 기능들을 모아 놓은 곳입니다. Android Police와 9to5Google 같은 소식통에 따르면 이 영역에는 딥 리서치, 이미지 생성, Veo를 통한 동영상 제작, Canvas, 가이드 러닝, Deep Think 등이 포함되며, 때로는 Google AI Pro나 Google AI Ultra와 같은 특정 구독 등급에 따라 이용 가능하기도 합니다.
반면 "랩스(Labs)"는 명확한 테스트 공간입니다. 제미니(Gemini) 선택기 내에 있는 전용 영역으로, 실험적인 기능으로 표시된 항목들을 모아 놓았습니다. 일반적으로 작은 플라스크 모양의 아이콘과 함께 제미니 에이전트(Gemini Agent), 다이내믹 뷰(Dynamic View, 시각적 레이아웃이라고도 함), 개인 지능(Personal Intelligence)과 같은 레이블이 표시됩니다. 랩스 아래의 항목을 클릭할 때는 간단한 사항을 염두에 두어야 합니다. 동작이 예고 없이 변경되거나, 사라지거나, 위치가 변경될 수 있습니다.
제품 디자인 관점에서 이러한 분리는 신뢰도에 중요한 영향을 미칩니다. AI 앱이 빠르게 성장할 때, 문제는 단순히 "기능이 너무 많다"는 것뿐만 아니라 "어떤 기능을 신뢰할 수 있는지 알 수 없다"는 것입니다. 제미니는 일상적인 도구를 한 영역에, 실험적인 기능을 다른 영역에 배치함으로써 자동차의 "일반" 모드와 "스포츠" 모드처럼 위험 요소를 명확하게 구분하고 있습니다.
안정적인 Gemini 도구: 심층 연구, 캔버스, 맞춤형 학습 등
대부분의 사용자를 위한 핵심 Gemini 도구 모음은 "도구" 아래에 있으며, 여기에는 Google이 사용자가 습관을 형성하도록 유도하는 다양한 기능이 있습니다. 정확한 구성은 계정 및 구독 수준에 따라 다를 수 있지만, 몇 가지 핵심 요소는 이미 공통적으로 포함되어 있습니다.
심층 연구 기능은 제미니를 일반적인 채팅 모델이 아닌 체계적인 연구 도우미로 변모시킵니다. 여러 출처를 탐색해야 하는 질문을 할 때, 심층 연구는 보다 명확한 단계별 프로세스를 따라 일관된 방법론을 제시하므로 사용자는 기능을 사용할 때마다 무엇을 기대할 수 있는지 알 수 있습니다.
이미지 및 비디오 콘텐츠 제작 도구(Veo 기반 통합 기능 포함)도 도구 메뉴에 있습니다. Gemini를 시각적 콘텐츠 제작에 사용하는 사용자는 이러한 기능이 실험적 기능으로 분류되어 변동이 심한 것이 아니라, 쉽게 찾을 수 있고 안정적으로 작동해야 합니다.
Canvas는 또 다른 핵심 기능입니다. 문서나 코딩 프로젝트를 프롬프트에서 바로 시작한 다음 Gemini를 사용하여 반복적으로 다듬을 수 있는 작업 공간 모드입니다. 요청 표시줄에서 "Canvas"를 선택하고 프롬프트를 입력하여 콘텐츠 또는 코드의 시작점을 생성한 다음, 대화형 병렬 레이아웃에서 계속 편집할 수 있습니다.
가이드 학습과 심층 사고는 특히 복잡한 주제에 대한 체계적인 도움을 원하는 사용자를 위해 인지 능력 향상에 초점을 맞춘 도구입니다. 가이드 학습은 마치 개인 교습처럼 단계별로 개념을 설명해 주고, 심층 사고는 어려운 문제에 대해 더 느리고 신중한 사고 과정을 거치도록 도와줍니다.
쌍둥이자리, 개인 교습가로 활용하기: 맞춤형 학습, 이미지 및 동영상
제미니 툴박스의 가장 사용자 친화적인 측면 중 하나는 안내식 학습 과정과 시각적 설명을 결합하여 마치 개인 교사처럼 활용할 수 있다는 점입니다. 단순히 텍스트만 나열하는 대신, 제미니는 이미지, 스케치, 심지어 동영상까지 활용하여 개념을 더 쉽게 이해할 수 있도록 도와줍니다.
실질적으로, 제미니에게 특정 주제에 대한 설명을 요청하면서 도표, 시각적 분석 또는 설명 이미지를 명시적으로 요청할 수 있습니다. 그러면 제미니는 해당 이미지를 설명에 직접 포함시켜 수학 개념, 작업 흐름 또는 과학적 과정 등을 시각화하는 데 도움을 줄 수 있습니다.
동영상 기반 학습도 지원되지만, 세부 사항은 지역 및 출시 단계에 따라 다릅니다. 일부 주제의 경우, Gemini는 텍스트 답변을 보완하는 동영상을 제시하거나 참조하여, 읽고, 보고, 질문에 상호 작용하는 과정을 통해 더욱 다양한 학습 방식을 제공합니다.
이 학습 모드는 Gemini 모바일 앱에 점진적으로 도입되고 있으므로 모든 옵션이 바로 표시되지 않을 수 있습니다. 그럴 경우 웹 환경을 이용하시면 되며, 단계적 출시 과정에서 Gemini의 기능들이 웹 환경에서 더 빨리 나타나는 경우가 많습니다.
Gemini Enterprise 및 Workspace: 팀을 위한 AI 에이전트
개인적인 용도를 넘어, Gemini 툴박스는 Gemini Enterprise 및 Google Workspace 통합을 통해 업무 환경으로 확장됩니다. 여기서는 일회성 알림에서 지속적인 에이전트, 워크플로 및 대규모 협업으로 초점이 옮겨집니다.
구글은 제미니 엔터프라이즈를 구글의 AI 기술을 모든 직원과 워크플로에 접목할 수 있도록 지원하는 고급 에이전트 플랫폼이라고 설명합니다. 실제로 제미니 엔터프라이즈를 통해 팀은 자사 데이터를 기반으로 하는 안전한 환경에서 AI 에이전트를 검색, 생성, 공유 및 실행할 수 있으며, 개발 병목 현상을 줄이고 영업 분석, 프로세스 자동화, 내부 지식 검색과 같은 다양한 활용 사례를 구현할 수 있습니다.
Google Workspace 자체는 Gemini로 강화된 협업 플랫폼 역할을 하며, Gmail, Docs, Meet과 같은 앱에 AI가 통합되어 있습니다. 사용자는 별도의 AI 도구로 전환할 필요 없이 일상적인 생산성 앱 내에서 Gemini를 호출하여 콘텐츠를 작성하고, 정보를 요약하거나, 상황에 맞는 아이디어를 생성할 수 있습니다.
일부 설정에서는 Google Workspace, Microsoft 365 및 기타 연결된 시스템에 저장된 기업 데이터를 기반으로 Gemini와 직접 채팅할 수도 있습니다. 이를 통해 Gemini는 IT 부서에서 구성한 권한 및 보안 설정에 따라 이메일, 문서 및 파일을 기반으로 질문에 답변할 수 있는 기업 지식 관리 도구로 활용될 수 있습니다.
제미니 API: 개발자 도구 상자의 핵심
사용자에게 보이는 제미니 앱 아래에는 개발자가 자신의 애플리케이션에 내장할 수 있도록 동일한 핵심 모델을 제공하는 제미니 API가 있습니다. 이 API는 다중 모드 지원, 함수 호출 및 사용자 지정 워크플로가 결합되어 특히 Google Workspace 및 Apps Script와 함께 강력한 자동화를 구현할 수 있는 곳입니다.
제미니 모델은 구글의 가장 강력한 AI 시스템이며, API는 텍스트 중심 버전과 비전 중심 버전 등 다양한 모델 변형을 제공합니다. 각 변형은 특정 기능과 한계를 가지고 있습니다. 구글 AI 스튜디오에서 이러한 모델을 시각적으로 탐색할 수 있습니다. 구글 AI 스튜디오는 코드를 작성하지 않고도 프롬프트를 실행해 보고, 모델 설정을 조정하고, 사용자 지정 모델을 튜닝할 수 있는 호스팅 인터페이스입니다.
API 사용을 시작하려면 Google AI Studio 또는 다른 지원되는 콘솔을 통해 API 키를 요청한 다음 간단한 REST API 호출로 테스트하면 됩니다. 예를 들어, 키를 GOOGLE_API_KEY와 같은 환경 변수에 저장하고 사용 가능한 모델 목록을 표시하는 엔드포인트를 호출하면 모든 설정이 올바르게 구성된 경우 models/gemini-1.0-pro 와 같은 JSON 응답을 받게 됩니다.
그 후, 콘텐츠 생성은 선택한 모델의 generateContent 메서드 와 같은 적절한 엔드포인트에 JSON 페이로드를 POST하는 방식으로 이루어집니다 . 최소 요청에는 텍스트 파트가 포함 된 contents 필드가 있으며, 선택 사항인 generationConfig 및 safetySettings 필드를 통해 온도 및 안전 필터와 같은 매개변수를 제어할 수 있습니다.
Apps Script에서 Gemini API 호출하기
Gemini 툴박스에서 가장 강력한 패턴 중 하나는 API와 Google Apps Script를 결합하여 Workspace 내 워크플로를 자동화하는 것입니다. 이 접근 방식을 사용하면 전체 백엔드를 구축하지 않고도 Drive, Calendar, Gmail, Sheets, Slides와 같은 서비스와 함께 Gemini를 오케스트레이션할 수 있습니다.
표준 설정은 Apps Script 프로젝트(예: script.new를 통해 생성)에서 시작하며, 이 프로젝트에 Gemini API 키를 스크립트 속성으로 저장합니다. 코드에서는 해당 값을 가져와 특정 모델(일반적으로 gemini-1.0-pro-latest:generateContent) 에 대한 엔드포인트 URL을 구성하고, API 키를 쿼리 매개변수로 전달합니다.
callGemini(prompt, temperature) 와 같은 헬퍼 함수는 일반적으로 JSON 페이로드를 생성하고, UrlFetchApp.fetch를 통해 전송한 다음 , 응답을 파싱하여 생성된 텍스트를 추출합니다. 이 래퍼를 사용하면 스크립트 내 여러 유틸리티에서 API를 반복적으로 사용하는 작업을 간소화할 수 있습니다.
테스트는 간단합니다. 프롬프트를 정의하고, 헬퍼 함수를 호출하며, 입력과 출력을 실행 로그에 기록하는 testGemini() 함수 를 만들면 됩니다 . 이 함수가 정상적으로 작동하면 Apps Script 환경과 Gemini API 키가 고급 시나리오를 위해 올바르게 연결되었음을 알 수 있습니다.
Gemini Vision 엔드포인트를 사용하여 이미지 처리
Gemini 툴박스는 멀티모달 지원, 특히 비전 지원 엔드포인트를 통한 이미지 처리 기능 덕분에 텍스트를 넘어 다양한 기능을 제공합니다. Apps Script에서는 일반적으로 gemini-1.0-pro-vision-latest:generateContent 와 같은 별도의 엔드포인트를 사용하며 , 이 역시 API 키로 매개변수화됩니다.
callGeminiProVision(prompt, image, temperature) 와 같은 일반적인 헬퍼 함수는 이미지 데이터를 base64로 변환하고, 적절한 MIME 유형으로 inlineData 에 포함시킨 후 텍스트 프롬프트와 함께 전송합니다. 그러면 모델은 이미지와 프롬프트에 대한 이해도를 반영한 텍스트를 반환합니다.
설정을 확인하려면 공개 URL에서 샘플 이미지를 다운로드하고, 이를 헬퍼 함수에 전달한 다음 Gemini Vision에서 생성된 흥미로운 사실이나 분석 결과를 로그에 출력하는 간단한 testGeminiVision() 함수를 작성해 볼 수 있습니다. 이러한 유형의 테스트는 멀티모달 입력이 환경에서 올바르게 작동하는지 보여줍니다.
일단 비전 흐름이 안정화되면, Google Sheets의 차트를 분석하거나 Drive에 저장된 이미지를 분석하는 것과 같은 상위 수준 자동화 작업에서 이를 재사용할 수 있습니다. 바로 이 지점에서 멀티모달리티가 단순한 데모 기능이 아닌, 진정으로 유용한 도구처럼 느껴지기 시작합니다.
함수 호출: 제미니에게 도구 접근 권한 부여
Gemini 툴박스의 또 다른 핵심 요소는 함수 호출 기능입니다. 이 기능을 통해 모델은 사용자가 만든 도구나 API를 언제 호출할지 결정할 수 있습니다. Gemini는 단순히 텍스트를 생성하는 대신, 어떤 함수를 어떤 인수로 사용할지 설명하는 구조화된 functionCall 객체를 반환할 수 있습니다.
Apps Script에서는 callGeminiWithTools(prompt, tools, temperature) 와 같은 헬퍼 함수를 설정하여 사용자 프롬프트와 함께 도구 사양을 전달할 수 있습니다. 이 사양은 함수 선언 스키마를 따르며, 함수의 이름, 목적 및 JSON 매개변수를 정의합니다.
Gemini가 특정 도구를 사용해야 한다고 판단하면, 스크립트에서 파싱하여 실제 구현으로 연결할 수 있는 함수 호출 객체를 응답에 포함합니다. 예를 들어, 현재 날짜와 시간을 반환하는 "datetime"이라는 이름의 스텁 도구를 정의하고, Gemini가 달력 계산과 관련된 문제를 해결하기 위해 해당 함수를 어떻게 요청하는지 살펴볼 수 있습니다.
함수 호출은 단일 요청뿐만 아니라 여러 단계에 걸쳐 작동할 수 있기 때문에 특히 강력합니다. 즉, 도구를 호출할 시점을 결정하고, 결과를 해석하고, 대화를 이어가는 더욱 복잡한 대화형 에이전트를 설계할 수 있습니다.
데모 통합: Gemini와 Google Workspace를 실용적인 도구 상자로 활용하기
텍스트 생성, 이미지 입력 및 함수 호출을 결합하면 Gemini 툴박스는 Workspace 자동화를 위한 실용적인 엔진이 됩니다. Google의 코드랩 자료에는 가능한 기능을 보여주는 몇 가지 구체적인 예제가 나와 있습니다.
간략히 설명하면, 사용자 문의는 다양한 워크플로우를 나타내는 여러 도구(회의 일정 예약, 차트를 이용한 이메일 초안 작성, 슬라이드 자료 제작 등)와 함께 Gemini로 전달됩니다. Gemini는 문의 내용에 따라 적절한 기능을 선택하고 시간, 파일 이름, 주제와 같은 구조화된 인수를 포함하는 함수 호출을 반환합니다.
앱 스크립트에서는 if…else 조건문 안에서 함수 호출을 해석하여 setupMeeting() , draftEmail() , createDeck() 과 같은 적절한 워크플로를 실행합니다 . 이러한 모델 추론과 명시적인 스크립트 로직의 조합이 Gemini를 단순한 채팅 창에서 실제 업무를 위한 도구 상자로 만들어 줍니다.
회의 자동화: 드라이브 파일 요약을 캘린더 이벤트로 만들기
한 데모에서는 Gemini를 사용하여 Google Drive에 저장된 텍스트 파일의 요약을 자동으로 포함하는 캘린더 회의를 설정하는 방법을 보여줍니다. 사용자는 "내일 오전 10시에 Helen과 Gemini-blog.txt 파일에 있는 뉴스를 논의하는 회의를 설정해 주세요."와 같이 입력할 수 있습니다 .
내부적으로는 도구 사양에 "setupMeeting"이라는 Workspace 도구가 선언되어 있으며, 시간, 수신자 및 파일 이름에 대한 매개변수가 지정됩니다. Gemini는 쿼리를 해석할 때 이 도구를 선택하고 이러한 인수가 채워진 함수 호출을 반환합니다.
해당 setupMeeting() 함수는 드라이브에서 지정된 파일을 찾아 내용을 읽고 callGemini() 함수를 통해 Gemini에 전달합니다. Gemini 는 이 함수에 제목과 간단한 요약을 포함하는 짧은 JSON 객체를 생성하도록 지시합니다. 응답은 JSON으로 파싱하기 전에 제거해야 하는 서식 지정 펜스로 둘러싸여 있을 수 있습니다.
추출된 제목과 요약을 사용하여 스크립트는 CalendarApp을 통해 캘린더 이벤트를 생성하고 , 설명을 요약으로 설정한 다음, 고급 캘린더 서비스를 통해 원본 파일을 첨부합니다. 결과적으로 컨텍스트가 포함된 회의 일정이 생성되며, 이 모든 과정은 단 하나의 자연어 요청으로 실행됩니다.
Gemini Vision을 사용하여 Sheets 차트에서 이메일 작성하기
Gemini 툴박스의 또 다른 워크플로는 Google Sheets의 차트를 분석하고 이를 기반으로 Gmail 메시지를 작성하는 것입니다. 예를 들어 대학 지출 내역을 스프레드시트로 정리해 두고, 그 차트의 내용을 요약하여 Mary라는 동료에게 이메일을 보내고 싶다고 가정해 보겠습니다.
사용자 쿼리는 "CollegeExpenses 시트의 차트에서 얻은 정보를 바탕으로 Mary에게 이메일을 작성해 주세요."와 같을 수 있습니다. "draftEmail"이라는 도구는 시트 이름과 수신자를 입력받도록 정의되어 있으며, Gemini는 이러한 유형의 요청을 받으면 해당 도구를 선택합니다.
draftEmail () 함수는 Google Drive에서 요청된 스프레드시트를 찾아 해당 시트를 열고 첫 번째 차트를 가져와 파일(예: ExpenseChart.png)로 저장합니다. 그런 다음 Gemini에게 차트의 정보만 사용하고 과거 데이터와의 비교는 피하며 메시지를 간결하게 유지하도록 지시하는 프롬프트를 생성합니다.
스크립트는 `callGeminiProVision(prompt, expenseChart)` 함수를 호출하여 프롬프트와 차트 이미지를 Gemini Vision으로 전송하고, Gemini Vision은 맞춤형 이메일 본문을 반환합니다. 마지막으로 스크립트는 수신자의 이메일 주소로 발송될 Gmail 초안을 생성하고, 제목을 "대학 학비"와 같이 설정한 후 차트 이미지를 첨부합니다.
이 패턴을 사용하면 제미니는 차트를 분석하고 핵심 내용을 추출하여 자연스러운 언어로 표현해주는 분석가로 거듭납니다. 초안을 검토하고 수정하는 작업은 여전히 사용자가 직접 수행하지만, 대부분의 핵심 작업은 자동으로 처리됩니다.
Gemini와 Google Slides를 사용하여 슬라이드 덱을 자동으로 만들기
이 툴박스의 세 번째 주요 데모 워크플로는 사용자가 지정한 주제에 대한 Google Slides 프레젠테이션의 기본 틀을 자동으로 만들어 줍니다. 예를 들어, "물 절약에 대한 프레젠테이션 자료를 만드는 데 도움을 주세요."라고 요청할 수 있습니다 .
"createDeck"이라는 도구가 "topic"이라는 단일 매개변수와 함께 선언되고, Gemini는 일련의 슬라이드를 설명하는 구조화된 JSON을 반환하도록 지시받습니다. 프롬프트는 Gemini에게 생성할 슬라이드 수(NUM_SLIDES와 같은 상수를 기반으로 함)를 알려주고, 간략한 제목과 글머리 기호를 요청하며, 스크립트가 안전하게 구문 분석할 수 있도록 유효한 JSON 객체를 명시적으로 요구합니다.
해당 프롬프트와 함께 callGemini()를 호출한 후 , 스크립트는 모든 서식 제한을 제거하고 JSON을 구문 분석한 다음 SlidesApp을 사용하여 새 프레젠테이션을 생성합니다. 첫 번째 슬라이드는 제목 페이지로 처리되고, 이후 슬라이드는 스크립트가 제목과 글머리 기호 텍스트를 채우는 TITLE_AND_BODY 레이아웃을 따릅니다.
몇 초 만에 슬라이드별로 구조화된 핵심 내용이 담긴 기본 프레젠테이션 자료를 얻을 수 있으며, 시각적으로 맞춤 설정할 준비가 완료됩니다. 결과물은 의도적으로 최소화되었지만, 이 워크플로는 Gemini를 통해 콘텐츠 구조를 빠르게 구성하여 디자인과 세부적인 내용에 집중할 수 있도록 하는 방법을 보여줍니다.
도구 상자 확장: 챗봇, RAG 및 다중 턴 도구
위 예시는 단지 시작점에 불과합니다. Gemini 툴박스는 API와 함수 호출에 익숙해지면 다양한 방향으로 확장할 수 있습니다. Google은 탐색해 볼 만한 여러 가지 방향을 명시적으로 제시하고 있습니다.
널리 사용되는 사례 중 하나는 Gemini API를 사용하여 Google Chat용 챗봇을 구축하는 것입니다. 여기에서도 동일한 패턴이 적용됩니다. 도구를 노출하고, Gemini가 언제 해당 도구를 호출할지 결정하도록 하며, 응답을 Chat 내의 대화형 인터페이스에 연결합니다. 이 모든 과정은 Chat API 및 관련 코드랩을 통해 관리됩니다.
또 다른 주요 방향은 Google Drive 또는 Google Keep에 저장된 개인 콘텐츠를 기반으로 검색 증강 생성(RAG)을 구현하는 것입니다. 단일 텍스트 파일을 요약하는 대신, Gemini API를 벡터 데이터베이스 및 선택적으로 LangChain과 같은 오케스트레이션 프레임워크와 결합하여 PDF, 이미지 및 메모에서 관련 스니펫을 가져온 다음 Gemini에 해당 문서를 기반으로 한 응답을 생성하도록 요청할 수 있습니다.
다중 턴 함수 호출은 에이전트가 어떤 도구를 어떤 순서로 사용할지 반복적으로 결정할 수 있도록 더욱 정교한 기능을 제공합니다. 에이전트는 단일 결정이 아닌, 함수를 호출하고 결과를 검토한 후 다른 함수를 호출하거나 추가 질문을 하는 등 모든 작업을 하나의 진행 중인 스레드 내에서 수행할 수 있습니다.
마지막으로, Workspace 내에만 머물러 있을 필요는 없습니다. Gemini API 패턴을 숙달하면 더 넓은 웹상의 외부 API에 모델을 연결할 수 있습니다. 이렇게 Gemini는 기업 내 업무 지원 도구에서 범용 디지털 업무 조정 도구로 전환할 수 있습니다.
안정적인 도구, 실험적인 랩, 튜터링 기능, 엔터프라이즈 에이전트 및 개발자 API를 모두 합치면 일반 학습자부터 고급 사용자까지 모두 만족시킬 수 있는 풍부한 Gemini 툴박스가 완성됩니다. Gemini를 하나의 앱이 아니라 계속해서 확장되는 악기 세트처럼 활용한다면, Google이 다음에 추가하는 기능을 매번 전체 워크플로를 재구성할 필요 없이 효과적으로 활용할 수 있을 것입니다.
공학자. 2012년부터 기술, 소프트웨어 및 하드웨어 애호가이자 기술 블로거

