이 영상에서 단테는 안드레이 카파시가 2025년에 공개한 두 시간 남짓의 영상 'How I use LLMs'에서 직접 질문하고, 도구를 바꾸고, 틀린 답을 확인하는 장면을 골라 해설합니다. 이어서 2026년 Anthropic의 사례를 바탕으로, 모델이 좋아졌을 때 하네스에서 무엇을 덜어낼 수 있는지 살펴봅니다. 기능 이름보다 오래 남는 AI 사용 습관을 찾는 분, 에이전트 작업 절차를 정리하려는 분께 맞는 내용입니다.
왜 카파시의 사용법을 다시 보나
카파시는 스탠퍼드에서 페이페이 리와 함께 딥러닝 강의 CS231n을 설계하고 주 강사로 가르쳤고(등록 인원이 2015년 150명에서 2017년 750명으로 늘었습니다), 2015년 OpenAI 창립 멤버로 참여한 뒤 테슬라에서 오토파일럿 컴퓨터 비전 팀을 이끌었습니다. 연구, 제품, 교육을 모두 겪은 사람이라 모델이 어떻게 작동하는지뿐 아니라 실제로 쓸 때 어디서 어긋나는지를 함께 보여 줍니다. 원본에는 파일 업로드가 막히거나 그래프에 없는 숫자가 들어가는 장면도 그대로 나옵니다.
단테는 앱과 기능을 외우는 대신 네 가지 질문으로 묶어 보자고 제안합니다. 어느 모델과 이야기하는지, 그 모델이 무슨 자료를 보는지, 어떤 도구를 쓸 수 있는지, 무엇을 넣고 어떤 형태로 받는지입니다.
대화 문맥, 모델 선택, 검색
카파시는 짧은 시를 요청한 뒤 대화를 토큰 단위로 보여 줍니다. 대화를 이어 가는 것은 앞의 내용 뒤에 새 내용을 붙이는 일이므로, 주제가 바뀌면 새 대화를 여는 습관을 소개합니다. 새 대화가 늘 좋은 것이 아니라, 지금 일에 어떤 문맥이 필요한지를 보라는 뜻입니다.
모델이 이미 아는 것과 새로 찾아야 하는 것도 구분합니다. 커피의 카페인 함량처럼 자주 등장하고 잘 변하지 않는 정보는 바로 물어볼 만하지만, 이번 주에 바뀐 정책 같은 것은 자료를 직접 주거나 검색하게 해야 합니다.
코드의 계산 검사가 실패하는 문제에서는 첫 모델이 점검 항목만 늘어놓고 원인을 찾지 못하자, 추론에 시간을 더 쓰는 모델로 바꿔 원인을 짚은 답을 얻습니다. 답이 부족할 때 자료가 부족한지, 도구가 없는지, 문제 자체가 어려운지 나눠 보는 것이 요점이고, 모델 교체는 그중 한 선택지입니다.
검색 장면에서는 드라마 '화이트 로터스' 시즌 3의 다음 회 공개일을 묻습니다. 검색을 거친 답에는 출처가 붙고, 같은 질문을 다른 앱에 넣으면 자동으로 검색하거나 최신 정보를 모른다고 답하는 차이가 드러납니다. 검색이 실행됐는지, 어떤 출처가 돌아왔는지 확인할 수 있는 것을 확인해야 결과를 잘못 해석하지 않습니다.
딥리서치, 문서 읽기, 계산 결과 검증
딥리서치에서 카파시는 영양제 성분의 작용 방식과 우려점처럼 조사 범위를 먼저 적고, 도구가 되묻는 질문에 범위를 정해 줍니다. 결과 보고서는 읽을거리의 출발점일 뿐입니다. 미국 언어 모델 연구소를 정리해 달라는 요청에서는 기대한 주요 회사가 빠진 표가 나왔습니다. 표가 깔끔해도 대상이 빠졌는지, 링크가 문장을 실제로 뒷받침하는지는 따로 봐야 합니다.
생물학 논문을 올렸을 때는 첫 시도에서 대화 길이 제한에 걸려 다른 도구로 옮겼습니다. 첨부 파일이 보이는 것과 그 문서를 이해한 답을 받는 것 사이에는 확인할 일이 남아 있습니다. 애덤 스미스의 『국부론』을 읽을 때는 책 이름만 말하지 않고 지금 읽는 장을 직접 넣은 뒤, 이해되지 않는 부분을 질문하고 다시 책으로 돌아갑니다.
계산 도구 장면이 특히 중요합니다. 큰 곱셈에서는 모델이 파이썬 프로그램을 만들고 실행 환경이 돌린 결과를 설명합니다. 그런데 기업가치 표를 그래프로 그리게 하자, 원자료에서 값이 없던 연도에 임의의 숫자가 채워졌습니다. 추세를 연장하게 했을 때는 그래프의 값과 답변의 값이 맞지 않아, 카파시가 변수를 직접 출력하게 해 확인했습니다. 입력이 맞는지, 처리 방식이 맞는지, 마지막 설명이 실제 결과와 같은지를 각각 봐야 하며 "실행 완료" 표시 하나로 결과를 확인했다고 볼 수 없습니다.
음성·이미지 입력과 반복 작업 정리
카파시는 휴대폰 받아쓰기로 질문을 입력하되, 제품명이나 전문 용어처럼 잘못 적힐 수 있는 단어는 직접 입력합니다. NotebookLM에 논문을 넣어 오디오로 만들어 듣는 장면도 있지만, 생성된 대화를 논문 자체로 받아들이면 안 됩니다. 이미지에서는 라벨 내용을 먼저 표로 옮겨 제대로 읽었는지 확인한 뒤 질문을 이어 갑니다. 숫자와 단위가 있으면 이 단계가 더 필요합니다.
기억 기능과 맞춤 지침도 구분합니다. 기억은 대화에서 알게 된 취향을 다음 대화에서도 참고하게 하고, 맞춤 지침은 원하는 답변 방식을 적어 둡니다. 카파시는 교육적인 설명과 한국어 답변의 격식을 지침에 넣었습니다. 한국어 문장에서 단어를 뽑는 맞춤 GPT, 한국어 자막 캡처를 읽고 번역해 풀어 주는 도구도 보여 주는데, 설정을 열어 보면 새 모델을 학습시킨 것이 아니라 지침과 출력 예시를 저장한 것입니다.
2026년 하네스에서 무엇을 덜어낼까
후반은 단테의 해설입니다. 하네스는 모델이 도구를 쓰고 작업을 이어 가도록 둘러싼 실행 구조입니다. 모델이 자주 놓치는 것을 보완하려고 붙인 절차는 모델이 바뀌면 다시 봐야 합니다.
단테가 인용한 Anthropic의 2026년 글은 다음 변경을 설명합니다(모델명은 당시 실험 조건입니다).
- Opus 4.5 기반 구성에서 명시적인 컨텍스트 리셋을 제거하고 자동 압축으로 작업을 이어 갔습니다. 덜어낸 것은 특정 리셋 절차이지 작업 기록 전체가 아닙니다.
- Opus 4.6을 적용하면서 스프린트 구조를 제거했습니다. 계획자와 평가자는 유지하되, 평가를 스프린트마다 하던 방식에서 작업 끝에 하는 방식으로 옮겼습니다.
- 평가자는 모델이 여전히 어려워하는 부분에서 계속 도움이 됐고, 계획자는 빼면 결과의 범위가 줄어 유지했습니다.
- 처음에 구성을 크게 줄였을 때는 기존 성능을 재현하지 못해, 한 요소씩 제거하며 영향을 보는 방식으로 바꿨습니다.
단테는 이를 우리 작업에 옮길 때의 기준을 제시합니다. 앱이 이미 하는 일을 따로 다시 시키는지, 같은 자료를 여러 단계에 반복 전달하는지, 실패 여부와 상관없이 정해진 횟수만큼 수정하는지를 점검 후보로 봅니다. 없애기 전에 그 절차가 어떤 실패를 막고 있었는지 적고, 같은 일을 같은 조건에서 한 장치만 바꿔 비교하며, 결과뿐 아니라 시간, 비용, 사람이 다시 손댄 부분도 함께 봅니다. 앞의 그래프 사례처럼 자료에 없는 값이 들어가는 문제가 여전하다면 확인 절차를 줄이는 것은 좋은 변경이 아닙니다. 단테는 이 비교 실험을 직접 수행하지는 않았다고 밝혔습니다.
정리
- 기능 이름 대신 모델, 참고 자료, 사용 도구, 입출력 형태라는 네 질문으로 AI 도구를 보면 변화에 덜 흔들립니다.
- 최신 정보는 검색이나 자료 제공으로 근거를 주고, 출처와 실행 여부를 확인합니다.
- 계산과 그래프는 입력, 처리, 최종 설명을 각각 원자료와 대조해야 합니다.
- 반복 작업은 지침과 출력 예시로 저장하되, 공통 조건과 일회성 조건을 구분합니다.
- 하네스는 한꺼번에 덜어내지 말고, 절차가 막던 실패를 확인하며 하나씩 줄여 봅니다.

