바로바로 챗GPT X 덕테이프 X 코덱스 · 01.1 챗GPT 필수 개념 이해하고 제품군 살펴보기
인공지능과 에이전트의 차이점
본격적인 실습에 앞서 챗GPT를 제대로 활용하기 위한 필수 개념들을 먼저 짚고 넘어갑니다. 스스로 실행하는 에이전트와 기존 인공지능의 차이를 살펴보고, 인공지능의 본체인 모델과 언어 처리 단위인 토큰의 원리를 학습합니다. 또한 답변의 품질을 좌우하는 컨텍스트 윈도우의 개념을 이해한 뒤 챗GPT와 코덱스 등 오픈AI의 주요 제품군을 가볍게 둘러봅니다. 웹 검색부터 덕테이프를 활용한 놀라운 이미지 생성, 그리고 다양한 파일 작업까지 핵심 도구들의 특징을 구경하며 기본기를 탄탄하게 다져봅시다.
미리 알아두세요!
- 에이전트는 스스로 계획, 실행, 평가까지 수행합니다.
아마 이 책을 펼친 독자라면 최근 주변에서 에이전트(Agent)라는 용어를 많이 사용하는 것 같다고 느꼈을 수도 있습니다. 그 이유는 챗GPT 등장 이후 인공지능의 발전 양상과 관련이 있습니다. 조금 지루한 이야기가 될 수 있지만 기술의 발전을 이해하기 위해 잠시 읽어보고 생각하는 시간을 가져봅시다.
인공지능은 모델이라고 생각하면 됩니다
요즘 이야기하는 인공지능이란 엄청나게 많은 데이터를 보고 학습한 모델을 말합니다. 챗GPT의 GPT 모델이나 Codex 모델을 떠올리면 됩니다. 초기 GPT 모델은 텍스트를 학습해서 사용자의 텍스트에 답을 내놓는 챗봇 같은 녀석이었습니다. 이것을 LLM 모델이라고 불렀습니다. 영어로 풀어 쓰면 Large Language Model입니다. 말 그대로 엄청나게 큰 언어 데이터를 학습해서 만든 모델이라는 뜻입니다. 그래서 우리의 프롬프트를 찰떡같이 알아듣고 답변해줬습니다.
NOTE
엄연히 말해 모델과 인공지능 서비스는 다른 것이지만 쉬운 설명을 위해 둘을 같은 선에 놓고 설명했습니다.
NOTE
실제로는 챗GPT라는 인공지능 서비스에 GPT 모델이 장착되어 있고, 이 모델이 실제 처리를 한 뒤 우리가 챗GPT라는 서비스에서 답변을 봅니다.

하지만 시간이 점차 지나면서 모델은 이미지도 생성할 수 있게 되었습니다. 그래서 LMM 모델이라는 용어가 생겼습니다. 영어로 풀어쓰면 Large Multimodal Model입니다. 여기서 멀티모달이란 인공지능이 받아들이고 처리할 수 있는 데이터의 종류를 의미합니다. 앞에서 LLM의 Language가 언어, 즉 텍스트만 취급하는 모델이었다면 이제는 텍스트, 이미지, 음성 등 다양한 데이터를 취급할 수 있는 모델이 되었다는 뜻이죠. 실제로 챗GPT에서 우리는 다양한 작업들을 할 수 있게 되었습니다.

여러분이 보고 계시는 이 도서의 삽화도 모두 챗GPT의 덕테이프로 만든 이미지입니다. 이 책을 모두 읽고 나면 여러분도 이런 그림을 자유자재로 그릴 수 있게 될 겁니다. 그럼 에이전트로 조금 더 나아가보겠습니다.
에이전트는 실행력이 있는 인공지능이라고 생각하면 됩니다
앞에서 설명한 모델을 사용할 때는 우리가 모두 실행자가 되어야 했습니다. 채팅창에서 프롬프트를 입력하고, 답을 기다렸다가 결과물을 받아서 다른 작업을 진행하는 등 사람이 주체가 되어서 행동해야 뭔가가 완료됩니다. 하지만 에이전트는 이 인공지능 모델을 활용해서 실행까지 하는 것을 말합니다. 궁극적인 에이전트는 아예 사람의 개입이 없어야 하지만 아직은 그런 단계는 아닙니다. 하지만 이미 대부분의 인공지능 서비스들은 절반 이상의 실행을 스스로 평가하고 행동합니다.

위 그림을 보면 기존 방식과 에이전트가 개입했을 때의 방식이 달라졌음을 알 수 있습니다. 기존 방식은 우리가 프롬프트를 입력하고 대기했다가 결과물을 보고 다른 작업을 진행하지만, 에이전트는 내부에서 스스로 작업을 반복해 어느 정도 완성도 있게 일을 마칩니다. 우리는 진짜 결과물만 보고 일할 수 있습니다. 이것이 인공지능과 에이전트의 차이점입니다.