[태그:] ChatGPT

  • ChatGPT 학습 끄기로는 사람 검토를 못 막는다

    ChatGPT 학습 끄기로는 사람 검토를 못 막는다

    3줄 요약

    • ChatGPT의 ‘모두를 위한 모델 개선’ 설정을 끄면 대화가 학습에 쓰이는 건 줄어들어요. 다만 사람이 대화를 검토하는 건 별개 문제라서 설정 하나로 누가 볼 가능성까지 모두 사라지진 않아요.
    • 학습 제외, 임시 채팅, 대화 삭제, 메모리 관리는 이름이 비슷해 보여도 막아주는 범위가 서로 달라요. 그래서 목적에 맞게 섞어 써야 해요.
    • 가장 확실한 방법은 주민등록번호, 계좌번호, 회사 기밀처럼 새어 나가면 곤란한 정보를 처음부터 입력하지 않는 거예요.

    9억 명. OpenAI 외주 인력이 사용자 대화를 읽고 있다는 404 Media 보도에 같이 붙어 나온 ChatGPT 사용자 수예요. 그리고 그 사용자 대부분은 이런 일이 벌어지는 줄 모를 거라는 지적이 따라왔고요. 이 보도가 유독 껄끄러운 건 숫자 때문만은 아니에요. ‘학습에 쓰지 않기’ 스위치 하나만 꺼두면 내 대화는 아무도 안 본다고 믿는 사람이 그만큼 많거든요. 오해를 풀려면 뭉쳐 있는 것부터 떼어놔야 해요. 학습 끄기, 임시 채팅, 삭제가 각각 무엇을 막아주는지 하나씩요.

    학습을 꺼도 사람이 읽는 건 별개로 남는다

    입력한 대화가 쓰이는 길은 크게 세 갈래예요. 이걸 한 덩어리로 보면 계속 헷갈려요.

    • 모델 학습: 대화 내용을 다음 모델을 훈련하거나 개선하는 데이터로 쓰는 경우예요. ChatGPT의 ‘모델 개선’ 설정이 손대는 게 주로 이 부분이에요.
    • 품질·안전 검토: 답변이 적절했는지 평가하거나 약관 위반, 악용을 잡으려고 사람이 대화 일부를 직접 들여다보는 경우예요. 외주 검토 인력이 등장하는 지점이 보통 여기예요.
    • 서비스 보관: 대화 목록, 메모리, 공유 링크처럼 사용자가 나중에 다시 보라고 서버에 저장해 두는 경우예요.

    설정 화면은 이 셋을 나눠서 보여주지 않아요. 학습을 끄는 버튼은 있는데 ‘사람 검토 끄기’ 같은 버튼은 아예 없거든요. OpenAI는 도움말과 개인정보 처리방침에서 안전·악용 모니터링을 위한 데이터 처리는 학습 제외 설정과 별도라는 취지로 안내하고 있어요. 스위치 하나 껐다고 누군가 대화를 볼 가능성까지 같이 꺼지는 구조가 아니라는 뜻이에요. 설정 화면만 놓고 보면 학습 스위치가 개인정보 보호의 전부처럼 읽히는데, 정작 이 차이는 화면 어디에도 따로 설명돼 있지 않아요.

    외주 인력이 어떤 대화를 어떤 기준으로 골라 읽었는지는 공개된 요약만으로 알 수 없어요. 학습 제외를 켜 둔 계정의 대화가 그 안에 섞여 있었는지도 마찬가지고요. 확인되지 않은 것들은 뒤쪽 ‘불확실한 것’ 목록에 따로 모아 뒀어요.

    ‘모두를 위한 모델 개선’ 스위치는 데이터 제어 안에 있다

    먼저 확인할 건 학습 활용 설정이에요. 웹에서는 대체로 이 순서예요.

    1. ChatGPT 웹 화면 왼쪽 아래의 프로필(계정 이름)을 눌러요.
    2. 설정 → 데이터 제어로 들어가요.
    3. ‘모두를 위한 모델 개선’ 항목을 꺼요.

    모바일 앱은 왼쪽 위 메뉴(≡) → 프로필 또는 계정 이름 → 데이터 제어 순서인 경우가 많아요. ChatGPT는 화면 구성이 자주 바뀌는 편이라 기기와 앱 버전에 따라 메뉴 위치도 이름도 조금씩 달라요. 한국어 화면에서는 영어 메뉴 ‘Data controls’와 ‘Improve the model for everyone’이 번역돼서 나와요. 안 보이면 설정 안에서 ‘데이터’나 ‘개선’이 들어간 항목을 훑어보세요.

    이 설정이 기기끼리 동기화되는지는 버전에 따라 달랐던 적이 있어요. PC와 스마트폰을 같이 쓴다면 기기마다 버튼 상태를 한 번씩 확인해 두는 게 안전해요. 답변 아래 좋아요·싫어요 피드백을 보낸 대화는 개선 목적에 활용될 여지가 있다는 취지의 안내도 있었고요. 민감한 대화에서 굳이 피드백 버튼을 누를 이유는 없어요. 정확한 적용 범위는 도움말 문서에서 직접 확인하는 편이 나아요.

    임시 채팅, 메모리, 삭제가 막아주는 범위는 제각각

    학습 제외 말고도 대화 흔적을 줄이는 기능이 몇 개 더 있어요. 이름만 보면 다 비슷비슷한데, 실제로 막아주는 범위는 꽤 달라요.

    기능 켜는 위치(버전에 따라 다름) 막아주는 것 못 막는 것
    모델 개선 끄기 설정 → 데이터 제어 설정한 뒤에 나눈 대화가 학습에 쓰이는 것 안전·악용 모니터링용 처리, 대화 목록 보관
    임시 채팅 새 채팅 화면 위쪽의 임시 채팅 버튼 대화 목록 저장, 메모리 반영, 학습 활용 안전 목적으로 서버에 일정 기간 남는 사본
    대화 삭제 대화 옆 메뉴(⋯) → 삭제, 또는 설정에서 전체 삭제 내 화면의 대화 목록 삭제하기 전에 이미 처리된 데이터, 서버에서 완전히 지워지기 전까지의 보관
    메모리 끄기·삭제 설정 → 개인 맞춤 설정 → 메모리 ChatGPT가 기억한 내 정보를 다시 쓰는 것 대화 자체의 보관과 학습 여부
    공유 링크 삭제 설정 → 데이터 제어 → 공유 링크 링크로 새로 열어 보는 것 이미 링크를 열어 복사해 간 내용

    표를 훑어보면 한 가지가 분명해져요. ‘내 대화 목록에서 사라진다’와 ‘서버에서 처리되지 않는다’는 전혀 다른 말이라는 것. 민감한 질문을 딱 한 번 할 거면 흔적이 가장 적게 남는 임시 채팅이 낫고, 평소 쓰던 계정을 통째로 점검하고 싶으면 모델 개선 끄기와 메모리 삭제를 같이 하는 쪽이 현실적이에요. 임시 채팅도 안전 목적의 사본은 남는다고 안내돼 있어요. ‘완전 비공개 모드’로 오해하면 곤란한 이유죠.

    설정보다 확실한 건 입력하기 전에 걸러내는 것

    설정은 결국 입력한 뒤의 관리예요. 제일 확실한 건 처음부터 넣지 않는 거고요. 엔터를 치기 전에 세 가지만 걸러 보세요.

    • 나를 알아볼 수 있는 정보인가: 실명, 주민등록번호, 휴대전화 번호, 주소, 계좌·카드 번호가 들어가면 빼거나 가명, 임의의 값으로 바꿔요.
    • 다른 사람의 정보인가: 고객 명단, 동료와 나눈 메시지, 가족의 진료 기록처럼 본인 동의 없이 넘기면 곤란한 정보는 요약하거나 익명으로 바꾼 뒤에 넣어요.
    • 새어 나가면 계약이나 법적 문제가 생기는가: 회사 소스코드, 공개 전 실적, 계약서 원문은 개인 계정 말고 회사가 승인한 도구에서만 다뤄요.

    이 기준이 중요한 진짜 이유는 따로 있어요. 사람이 검토할 대화를 어떤 방식으로 뽑는지가 사용자에게 공개되지 않는다는 점이에요. 내 대화가 뽑힐지 말지를 사용자가 정할 방법이 없으니, ‘뽑혀도 문제없는 내용만 넣는다’는 원칙이 어떤 설정보다 오래 버텨요. LLM이 대규모 감시를 한층 키울 거라는 MIT Technology Review의 분석도 결이 같아요. 대화 데이터는 한번 쌓이고 나면 원래 목적과 다른 곳에 쓰일 여지가 생기거든요.

    국내 독자가 챙길 것: 회사 업무와 자녀 계정 점검

    • 개인 계정으로 회사 일을 하는 경우: OpenAI는 기업용 요금제 데이터를 기본적으로 학습에 쓰지 않는다고 안내해요. 개인 계정은 얘기가 달라요. 무료든 유료든 사용자가 직접 설정을 꺼야 해요. 회사 보안 규정에 생성형 AI 사용 지침이 있는지부터 확인하세요.
    • 한국어 메뉴 이름 차이: 번역된 메뉴 이름이 업데이트 때마다 조금씩 바뀌어서, 블로그나 영상에서 본 이름이 실제 화면과 안 맞는 경우가 흔해요. 이름을 외우기보다 ‘설정 → 데이터 관련 항목’이라는 위치로 기억해 두는 게 나아요.
    • 한국 사용자 대상 변경은 확인된 게 없어요: 외주 검토 보도 이후 한국 사용자에게 적용되는 정책이 바뀌었다는 공식 발표는 확인되지 않아요. 한국어 서비스에만 따로 적용되는 데이터 처리 방식이 있다는 안내도 찾기 어렵고요. 전 세계 공통 정책을 그대로 따른다고 보고 설정을 챙기는 게 현실적이에요(추측).
    • 자녀가 쓰는 계정: EU는 15세 미만이 SNS와 AI 챗봇을 쓸 때 부모 감독을 받도록 하는 방안을 추진하고 있다고 알려졌어요. 어디까지나 EU의 계획이라 국내에 바로 적용되는 규정은 아니에요. 비슷한 논의가 국내로 번질지는 지켜봐야 하고요(추측). 자녀가 ChatGPT를 쓴다면 위의 설정을 보호자가 같이 점검해 두세요.

    확인된 것과 아직 불확실한 것

    확인된 것

    • 404 Media는 OpenAI 외주 인력이 사용자의 ChatGPT 대화를 읽고 있다고 보도했어요.
    • 이 보도를 소개한 뉴스레터는 ChatGPT 사용자를 9억 명으로 언급했어요.
    • ChatGPT에는 학습 활용 끄기, 임시 채팅, 메모리 관리, 대화 삭제 기능이 따로 있어요(메뉴 위치는 버전에 따라 달라요).
    • EU가 15세 미만의 SNS·AI 챗봇 이용에 부모 감독을 요구하는 방안을 계획하고 있다고 Politico가 전했어요.

    아직 불확실한 것

    • 외주 인력이 읽은 대화를 어떤 기준으로 골랐는지
    • 학습 제외를 켜 둔 사용자의 대화도 검토 대상에 들어갔는지
    • 검토할 때 이름, 연락처 같은 개인 식별 정보가 가려졌는지
    • OpenAI가 검토 절차나 설정 화면을 바꿀지, 한국 사용자에게 따로 안내가 나올지
    • EU 방안이 최종 확정될지, 비슷한 규정이 다른 지역으로 퍼질지

    AI 안전 논쟁은 갈려도 내 계정 관리는 내 몫

    업계 분위기부터가 한 방향이 아니에요. 다리오 아모데이, 샘 올트먼, 일론 머스크, 데미스 허사비스 같은 AI 기업 수장들은 최신 LLM이 안전하지 않다는 데 의견을 모으는 모습이에요. Anthropic 공동창업자는 AI 킬 스위치를 의무화해야 할지도 모른다고 했고요. 반대편에는 트럼프 대통령이 있어요. AI 안전 우려를 ‘사기(hoax)’라고 부르면서 추가 안전장치를 거부했죠. 규제 방향이 이렇게 갈리는 동안, 사용자가 기다린다고 알아서 정리되는 건 별로 없어요.

    오늘 할 일은 세 단계면 충분해요. 설정 → 데이터 제어에서 모델 개선 버튼이 꺼져 있는지 확인. 메모리에 저장된 내 정보를 훑어보고 필요 없는 항목 삭제. 민감한 질문은 개인 식별 정보를 뺀 채 임시 채팅에서. 이 셋을 다 해도 누군가 내 대화를 볼 가능성이 0이 되진 않아요. 설정을 잘못 눌러서가 아니라, 안전 검토가 학습 스위치 바깥에 있는 구조라서 그래요. 대신 그 구조를 알고 나면 무엇을 입력하고 무엇을 뺄지 판단이 훨씬 빨라져요. 끝까지 지켜지는 건 내가 애초에 넣지 않은 정보뿐이니까요.

    출처: MIT Tech Review AI

  • AI 추론 모델이란 뭐길래, 수학 난제까지 풀었나

    AI 추론 모델이란 뭐길래, 수학 난제까지 풀었나

    오픈AI 에이전트가 수십 년째 안 풀리던 수학 난제를 풀었다는 소식이 떴다. 코드 몇 줄 짜주고 이메일 초안이나 잡아주던 그 AI 맞나 싶다. 대학원 수준 증명 문제까지 건드린다니, 솔직히 처음 봤을 땐 좀 의심부터 들었다. 이 변화 뒤에는 ‘추론 모델(reasoning model)’이라는 새로운 방식이 있다. 정확히 뭔지, 일반 챗봇이랑 뭐가 다른지, 실무에서 언제 꺼내 쓰면 되는지 정리해봤다.

    추론 모델, 그래서 정확히 뭐냐면

    질문 받자마자 바로 답부터 뱉는 게 아니라, 문제를 잘게 쪼개서 단계별로 따져본 다음에 결론을 내는 방식이다. 사람이 어려운 수학 문제 풀 때 종이에 풀이 과정 적어가면서 검산하는 것, 딱 그 구조다. 이걸 체인 오브 소트(Chain of Thought)라고 부른다. 모델이 스스로 ‘이 접근 맞나?’ 되짚어보고, 틀렸다 싶으면 다른 경로로 다시 계산한다. 오픈AI의 o1, o3 계열이나 그 이후 모델들이 대표 사례다. 이 구조 덕분에 복잡한 논리 문제나 수학 증명에서 정답률이 눈에 띄게 올라갔다.

    일반 챗봇이랑 뭐가 다르냐

    속도와 정확도, 이 둘의 트레이드오프로 요약된다.

    • 일반 모델: 몇 초 안에 답이 나온다. 일상 대화나 간단한 요약엔 이거로 충분하다.
    • 추론 모델: 답 나오기까지 수십 초에서 몇 분씩 걸리고 토큰도 훨씬 많이 먹는다. 대신 여러 단계 거쳐야 하는 수학·코딩·논리 문제에서 오답률이 크게 준다.
    • 오늘 날씨 물어보는 수준 질문에 추론 모델 켜는 건… 시간과 비용만 날리는 짓이다.

    AI가 갑자기 수학을 잘하게 된 진짜 이유

    핵심은 강화학습 방식이 바뀐 데 있다. 예전엔 사람이 답변 품질을 채점하는 방식(RLHF)이 주류였다. 근데 이 방식, 문장이 자연스러운지는 잘 판단해도 수학 정답이 맞는지는 정확히 못 걸러냈다. 최근엔 답이 명확하게 검증되는 문제, 그러니까 수학이나 코딩 문제로 강화학습을 시키는 쪽으로 자리 잡았다. 정답을 자동으로 채점할 수 있으니까, 모델이 혼자 수백만 번 풀이를 시도하고 틀리면 페널티를 받는 식으로 훈련된다. 여기에 계산기나 코드 실행기 같은 외부 도구를 직접 불러다 검산하는 에이전트 형태까지 붙으면서, 사람이 몇 주씩 매달릴 증명 작업을 AI가 대신 시도해보는 사례까지 나왔다. 실제로 오픈AI 에이전트가 오랫동안 미해결로 남아있던 수학 문제 하나를 풀어낸 게 이번 소식인데, 그 배경에 바로 이 검증 가능한 보상 구조가 있다.

    지금 나와 있는 대표 추론 모델들

    • 오픈AI o1 / o3 계열: 최초로 대중화된 추론 특화 모델. 수학 올림피아드급 문제나 박사급 과학 질문에서 강하다.
    • 구글 제미나이(Gemini) 씽킹 모델: 추론 과정을 공개하는 옵션이 있어서 검증이 상대적으로 쉽다.
    • 클로드(Claude)의 확장 사고(Extended Thinking): 필요할 때만 깊게 생각하도록 조절 가능하다. 비용 관리 면에서 이게 편하다.
    • 딥시크(DeepSeek) R1: 오픈소스로 풀렸다. 직접 서버에 올려서 돌릴 수 있다는 게 제일 큰 차별점.

    실제로 써보면 언제 효과 보나

    이런 상황에서는 확실히 차이가 느껴진다.

    • 여러 파일에 걸쳐 원인을 추적해야 하는 복잡한 버그 디버깅
    • 통계 문제나 확률 계산처럼 중간 단계가 많은 수학 문제
    • 계약서나 논문처럼 논리적 허점을 찾아야 하는 검토 작업
    • 조건 여러 개를 동시에 고려해야 하는 일정·예산 최적화

    반대로 이메일 답장, 짧은 문서 요약, 잡담 같은 건 일반 모델로 충분하다. 굳이 추론 모델 켜봐야 답변만 늦어진다.

    한계도 분명히 있다

    추론 모델이라고 만능은 아니다. 풀이 과정이 그럴싸해 보여도 중간에 계산 실수가 섞여 있는 경우가 종종 있다. 자릿수 많은 계산에서는 여전히 틀린다. 결과를 그냥 믿기보다 핵심 숫자는 직접 검산하는 습관, 들이는 게 안전하다. 비용도 문제다. 일반 모델보다 토큰을 몇 배씩 먹기 때문에, 매번 추론 모델만 돌리면 API 비용이 생각보다 빨리 불어난다.

    결국 뭘 골라야 하나

    기준은 단순하다. 답이 명확하게 검증되는 수학·코딩·논리 문제면 추론 모델 켜고, 속도가 급한 일상 업무면 일반 모델로 가면 된다. 상황 봐가며 두 방식을 오가는 게 지금으로선 제일 현실적인 활용법이다. 앞으로 두 계열 모델의 경계는 점점 흐려질 거고, 언젠가는 이런 구분 자체가 무의미해질지도 모른다.

    출처: MIT Tech Review AI

  • AI 벤치마크 테스트, 점수만 보고 속으면 안 되는 이유

    AI 벤치마크 테스트, 점수만 보고 속으면 안 되는 이유

    체스판에서는 이미 인간을 한참 앞서간 AI다. 그런데 초등학생도 곧잘 푸는 미로 찾기나 성냥개비 퍼즐 앞에서는 자주 멈칫한다. GPT, 클로드, 제미나이 같은 최신 모델에 논리 퍼즐 몇 개만 던져봐도 이 허점은 금방 드러난다. 점수판 숫자는 화려한데, 막상 손으로 풀려보면 딴판인 경우가 꽤 많다. 왜 이런 일이 생기는지, AI 성능을 제대로 가늠하려면 뭘 봐야 하는지 정리해봤다.

    AI 벤치마크, 대체 뭘 재는 시험일까

    AI 벤치마크는 모델 능력을 숫자로 비교하려고 만든 표준화된 문제 세트다. 사람으로 치면 수능이나 토익 같은 거다. 개발사들이 신모델 낼 때마다 “전작보다 몇 % 향상”이라고 내세우는 근거가 바로 이 점수인데, 문제는 시험 종류가 너무 많고 시험마다 재는 능력도 제각각이라는 점이다. 수학은 잘 푸는데 상식 문제엔 헤매는 모델도 있고, 코딩은 잘하면서 공간 추론은 형편없는 경우도 흔하다.

    실무에서 자주 쓰는 AI 지능 테스트 5가지

    업계에서 자주 인용되는 테스트를 추려보면 이렇다.

    • MMLU: 역사, 법학, 의학 등 57개 분야 객관식 문제로 폭넓은 지식을 잰다
    • GPQA: 박사급 전문가도 쩔쩔매는 과학 문제 모음. 구글 검색으로도 못 푸는 난이도가 특징이다
    • HumanEval / SWE-bench: 실제 코드 작성과 버그 수정 능력을 평가하는 코딩 테스트
    • ARC-AGI: 색깔 블록 패턴을 보고 규칙을 유추하는 문제. 사람은 직관적으로 풀지만 AI는 여전히 낮은 점수대에 머문다
    • 체스·바둑·전략 게임 벤치마크: 규칙이 명확한 환경에서 계획 세우는 능력을 확인한다

    AI가 유독 못 푸는 문제들

    언어 기반 지식 문제는 해마다 점수가 쭉쭉 오르는데, 공간 추론이나 시각 패턴 문제는 진전이 더디다. ARC-AGI처럼 “규칙을 직접 찾아내야 하는” 문제에서는 상위권 모델조차 20~30% 정답률에 그치는 일이 많다. 물체 개수 세기, 미로 경로 찾기, 시각적 대칭 판단처럼 사람에겐 거의 본능에 가까운 작업이 AI한테는 오히려 어렵다. 학습 데이터에 정답 패턴이 충분치 않거나, 언어로 설명하기 힘든 감각적 판단이 필요한 영역이라 그렇다.

    벤치마크 점수만 믿고 모델 고르면 안 되는 이유

    벤치마크 점수와 실제 써본 경험이 어긋나는 경우, 생각보다 잦다. 원인은 크게 두 가지다. 하나는 데이터 오염. 벤치마크 문제와 정답이 이미 학습 데이터에 들어가 있으면, 모델이 “풀었다”기보다 “외웠다”에 가깝다. 다른 하나는 리더보드 최적화다. 특정 시험 점수 올리는 데만 튜닝을 집중하면 다른 영역 성능이 희생되기도 한다. 그래서 회사들이 내놓는 벤치마크 표만 믿고 도구를 정하면, 막상 써봤을 때 실망하는 일이 생긴다. 이건 좀 억울한 부분이다.

    내 손으로 직접 AI 지능 테스트 해보는 법

    직접 확인하고 싶다면 이런 방식이 유용하다.

    • 같은 논리 퍼즐을 챗봇 3~4개에 동시에 물어보고 답을 비교한다
    • 정답보다 풀이 과정을 요구해서 논리가 맞는지 확인한다 (답만 맞고 과정은 틀린 경우가 의외로 많다)
    • 숫자 세기, 방향 감각, 시간 계산처럼 쉬워 보이지만 헷갈리는 문제로 테스트한다
    • 같은 질문을 표현만 바꿔서 두 번 물어보고 답이 일관되는지 본다
    • 실제로 반복하는 업무, 그러니까 이메일 작성이나 코드 리뷰, 데이터 정리 같은 걸로 직접 검증한다

    벤치마크 사이트 점수보다 이런 실전 테스트가 도구 선택엔 훨씬 도움이 된다.

    결국 뭘 기준으로 골라야 하나

    벤치마크는 대략적인 방향 잡는 참고 자료 정도로 보면 된다. 코딩용이면 SWE-bench나 HumanEval 점수를, 학습·연구용이면 MMLU나 GPQA 점수를 먼저 확인하고, 최종 판단은 본인이 자주 쓰는 업무로 직접 테스트해서 내리는 게 안전하다. 점수표 상위권이라고 무조건 최선은 아니다. 특정 영역에서 약점이 뚜렷한 모델이 다른 영역에서는 압도적인 경우도 많다. 결국 벤치마크를 보는 이유는 하나다. 내 용도에 맞으면서 약점 없는 모델을 찾는 것.

    출처: MIT Tech Review AI

  • AI 업무 활용법 TOP 10, 실제로는 이렇게 쓰더라

    AI 업무 활용법 TOP 10, 실제로는 이렇게 쓰더라

    챗GPT 주간 사용자, 8억 명. 어마어마한 숫자다. 근데 정작 코드 짜고 데이터 뽑는 데 쓰는 사람은 소수라는 조사 결과가 나왔다. 다들 AI를 업무 혁신 도구라 부르면서, 실제로 제일 많이 하는 건 이메일 초안 하나 다듬는 일이라는 얘기다. 그래서 실제로 사람들이 AI를 어디에, 어떻게 쓰는지 — 손해 안 보고 제대로 활용하는 법을 정리해봤다.

    숫자와 실제 사용법, 꽤 다르다

    AI 기업들이 내놓는 사용량 보고서엔 늘 생산성 혁신, 코드 자동화 같은 화려한 사례가 앞줄에 선다. 그런데 실제 사용 로그는 다른 얘기를 한다. 가장 많이 쓰이는 건 단순 텍스트 작성, 요약, 그리고 검색 대신 던지는 질문이다. 개발자 커뮤니티만 봐도 코딩 어시스턴트로 산다는 사람보다 귀찮은 문서 정리에 쓴다는 사람이 훨씬 많다. 보고서가 보여주는 잠재력과 일상에서 체감하는 활용도, 이 간극이 생각보다 크다.

    업무에서 진짜 써먹는 3가지

    실전에서 반복되는 패턴은 의외로 단순하다.

    • 초안 작성 — 보고서, 이메일, 기획서 뼈대를 잡을 때. 완성본이 아니라 시작점 용도로 쓰면 시간이 확실히 준다.
    • 요약과 정리 — 긴 회의록이나 논문, 계약서를 몇 줄로 압축할 때. 원문 대조 없이 그대로 믿는 건 위험하지만, 1차 스크리닝으론 효율적이다.
    • 코드 리뷰 보조 — 개발자라면 전체 코드를 통째로 맡기기보다 특정 함수의 버그를 찾거나 리팩터링 아이디어를 물어보는 쪽이 실패율이 낮다.

    일상에서는 좀 더 사적으로 쓴다

    업무 밖에서는 훨씬 개인적인 용도로 쓰인다. 여행 일정 짜기, 요리 레시피 변형, 아이 숙제 봐주기 — 이런 생활밀착형 질문이 상당수다. 감정적인 고민을 털어놓거나 대화 상대 삼는 사람도 늘고 있다는 조사도 있다. 통계엔 잘 안 잡히는 용도지만, 실제 쓰는 시간으로 치면 업무용보다 긴 경우도 드물지 않다.

    ChatGPT, 클로드, 제미나이 — 뭘 언제 쓰나

    세 서비스, 비슷해 보여도 강점은 갈린다.

    • ChatGPT — 플러그인과 GPTs 생태계가 넓어서 범용 작업에 강하다. 검색 연동도 자연스러운 편.
    • 클로드 — 긴 문서를 통째로 넣고 분석시킬 때 안정적이다. 코드 작성이나 리팩터링 평가가 좋다.
    • 제미나이 — 구글 문서, 지메일 같은 워크스페이스와 붙여 쓸 때 편하다.

    하나만 고집하기보다 작업 성격 따라 갈아타는 사람도 많다. 솔직히 여기서 호불호가 갈린다. 문서 분석은 클로드, 일상 질문은 ChatGPT, 구글 서비스 연동은 제미나이 — 이렇게 나눠 쓰는 조합이 커뮤니티에서 자주 추천된다.

    프롬프트 한 줄 차이로 결과가 갈린다

    같은 모델이라도 질문 방식에 따라 결과물 품질이 크게 달라진다.

    • 맥락을 먼저 준다 — "이 이메일을 정중하게 다듬어줘"보다 "고객 클레임에 답하는 이메일인데, 사과하되 책임은 명확히 하는 톤으로 다듬어줘"가 훨씬 낫다.
    • 출력 형식을 지정한다 — 표, 불릿, 글자 수 제한을 미리 알려주면 다시 물어볼 일이 준다.
    • 한 번에 끝내려 하지 않는다 — 초안 받은 뒤 "이 부분만 더 짧게" 식으로 이어가는 대화형 사용이 결과가 가장 좋다.

    이렇게 쓰면 오히려 손해

    AI 답변을 검증 없이 그대로 제출했다가 낭패 보는 사례, 여전히 흔하다. 법률 자문이나 의료 정보처럼 사실관계가 걸린 영역에서는 AI 답변을 최종 근거로 삼으면 안 된다. 최신 뉴스나 실시간 데이터를 물을 때도 학습 시점 이후 정보는 부정확할 여지가 있다. 사내 기밀이나 개인정보를 프롬프트에 그대로 붙여넣는 습관도 보안 사고로 이어질 여지가 있다 — 이건 진짜 조심해야 한다. 쓰기 전에 한 번은 사람이 검토하는 절차, 꼭 두는 게 안전하다.

    그 밖에 궁금한 것들

    • 무료 버전으로 충분할까? 간단한 요약이나 초안 작업은 무료 플랜으로 충분하다. 다만 긴 문서 분석이나 최신 모델 성능이 필요하면 유료 전환 체감 차이가 크다.
    • 회사에서 AI 사용을 막아놨다면? 보안 정책 때문인 경우가 대부분이니, 사내 승인된 도구가 있는지부터 확인하는 게 순서다.
    • 어떤 모델이 제일 정확한가? 절대적으로 우월한 모델은 없다. 작업 종류에 따라 강점이 바뀐다. 코드는 클로드, 검색 연동은 ChatGPT 쪽 평가가 대체로 낫다.

    출처: MIT Tech Review AI

  • AI 에이전트 완전정복 — 챗봇과 뭐가 다르고, 어떻게 써야 하나

    AI 에이전트 완전정복 — 챗봇과 뭐가 다르고, 어떻게 써야 하나

    회사 슬랙에 “Alex가 팀에 합류했습니다”라는 공지가 떴다. 인사팀이 아니다. 신입도 아니다. AI 에이전트다. 이름이 있고, 업무 범위도 있고, 채널에 초대도 됐다. 솔직히 이쯤 되면 헷갈린다. 챗봇이랑 뭐가 다른 건지, 어디까지 믿어야 되는 건지, 어떻게 써야 제대로 쓰는 건지.

    챗봇과 뭐가 다른가 — 한 줄로 정리하면

    핵심은 ‘자율성’이다. 챗봇은 질문 받고 답한다. 거기서 끝. 반면 AI 에이전트는 목표를 주면 스스로 계획 세우고, 도구 꺼내 쓰고, 결과 확인하고, 다음 단계까지 알아서 결정한다.

    “이번 달 경쟁사 가격 조사해줘”라는 지시 하나로 비교해보면 차이가 확 온다:

    • 챗봇: 어떻게 조사하면 되는지 방법을 알려준다
    • AI 에이전트: 웹 직접 뒤지고, 데이터 긁어오고, 스프레드시트 정리에 보고서까지 만든다

    구조적으로는 LLM(대형 언어 모델)에 도구 사용 능력(Tool Use)과 반복 실행 루프(ReAct 방식 등)를 얹은 형태다. 챗봇이 ‘대화 엔진’이라면, 에이전트는 ‘자율 실행 시스템’에 가깝다. 이 차이가 생각보다 크다.

    실제로 뭘 처리하나

    범위가 생각보다 넓다. 현재 AI 에이전트가 다루는 작업들:

    • 웹 검색 및 실시간 정보 수집
    • 코드 작성 및 직접 실행
    • 이메일·캘린더·문서 자동 관리
    • 외부 API 호출 및 데이터 가공
    • 파일 읽기·쓰기·분류·요약
    • 여러 단계로 이어지는 복합 업무 자동화

    Anthropic의 Claude는 컴퓨터 화면을 직접 보면서 마우스와 키보드까지 조작하는 ‘Computer Use’ 기능을 내놨다. OpenAI의 Operator는 브라우저를 에이전트가 직접 조작해서 예약·쇼핑·양식 작성을 처리한다. n8n이나 Make 같은 자동화 툴과 연결하면 수십 개 앱을 엮은 복잡한 워크플로우도 가능하다. 이쯤 되면 ‘도구’라는 말이 좀 부족하게 느껴지긴 한다.

    ‘AI 동료’라는 말이 위험한 이유

    기업들이 AI 에이전트에 이름을 붙이고 “디지털 동료”, “AI 팀원”으로 부르기 시작했다. 이해는 한다. 슬랙에 올라오고 메일도 보내니까. 근데 이 표현이 생각보다 큰 오해를 만든다.

    첫째, 에이전트는 책임지지 않는다. 잘못된 보고서 만들어도, 실수로 파일 날려도 사과 안 한다. 결과 책임은 여전히 사람한테 있다.

    둘째, 맥락 이해에 한계가 있다. 회사의 암묵적 문화, 동료 사이 역학, 팀 내 분위기 같은 건 에이전트가 파악하기 어렵다. “이 메일은 CC에 팀장 빼는 게 낫겠어”라는 판단은 아직 사람만 할 수 있다.

    셋째, 과신이 실수를 부른다. 동료처럼 느껴지면 검증을 건너뛰게 된다. 솔직히 이 부분이 가장 우려스럽다. 사람이라면 “잘 모르겠는데요”라고 하지만, 에이전트는 모를 때도 당당하다. 자신 있게 틀린 정보를 내놓는 건 현재 LLM의 고질적인 특성이다. AI 에이전트 출력물은 반드시 확인해야 한다.

    제대로 쓰는 법 — 잘 활용하는 팀의 공통점

    결국 핵심은 ‘강력한 도구’로 대하는 태도다. 전동 드릴이 강력해도 설계를 드릴한테 맡기지 않듯, 에이전트가 강력하다고 판단을 위임하면 안 된다.

    실제로 잘 쓰는 팀들이 하는 것들:

    • 지시를 구체적으로 작성한다. “마케팅 자료 만들어줘”보다 “경쟁사 A·B·C의 가격 페이지를 비교해서 3개 항목으로 요약한 표를 만들어줘”가 훨씬 낫다
    • 반복적이고 정형화된 업무부터 넣는다. 판단이 필요한 작업보다 룰이 명확한 작업부터. 이게 안전하다
    • 중간 결과를 반드시 본다. 최종 산출물만 보지 말고, 에이전트가 어떤 단계를 거쳤는지 확인하는 습관이 필요하다
    • 접근 권한을 최소화한다. 불필요한 권한을 주면 예상치 못한 사고로 이어진다

    툴 비교 — 뭘 골라야 하나

    목적에 따라 달라진다. 대표적인 선택지들:

    • Claude (Anthropic): 코딩, 문서 분석, 컴퓨터 직접 조작. 복잡한 멀티스텝 작업과 긴 문서 처리에 강하다
    • ChatGPT + GPT Actions: 외부 서비스 API 연동, 플러그인 생태계가 풍부하다. 범용 업무에 무난한 선택
    • Gemini (Google): Gmail, Docs, Drive 연동에 최적화돼 있다. 구글 워크스페이스 사용자라면 진입장벽이 낮다
    • n8n / Make: 코드 없이 AI 에이전트 워크플로우 구성 가능. 중소기업이나 비개발자에게 실용적이다
    • CrewAI / AutoGPT: 여러 에이전트를 팀처럼 구성해서 협력 실행. 개발자 친화적이고 복잡한 파이프라인 구축에 맞다

    뭘 고르든, 처음부터 큰 작업을 맡기기보다 작은 단위 테스트로 신뢰를 쌓아가는 게 현실적이다. 이건 어느 툴이나 마찬가지다.

    도입 전 반드시 체크할 것들

    도구가 좋다고 무작정 들이면 오히려 독이 된다. 조직에 AI 에이전트를 넣기 전에 확인해야 할 것들:

    • 에이전트가 접근할 수 있는 데이터 범위를 명확히 정했는가
    • 에이전트 출력물을 최종 검토할 담당자가 지정돼 있는가
    • 외부로 데이터를 전송하지 않는지 확인했는가 (사내 보안 정책과의 충돌 여부)
    • API 호출 기반 서비스라면 사용량에 따른 비용 급증 시나리오를 검토했는가
    • 에이전트가 실수했을 때 롤백하거나 수정할 프로세스가 마련돼 있는가

    AI 에이전트는 업무 방식을 바꿀 기술이다. 이건 맞다. 다만 그 변화를 제대로 이끌려면 도구를 이해하고, 한계를 직시하고, 인간의 판단이 어디서 들어가야 하는지 먼저 설계해야 한다. ‘동료’가 아니라 ‘강력한 도구’로 대할 때, 에이전트는 진짜 힘을 발휘한다.

    출처: MIT Tech Review AI

  • AI 에이전트, 챗봇이랑 뭐가 다른가 — 작동 원리와 앱 5종 비교

    AI 에이전트, 챗봇이랑 뭐가 다른가 — 작동 원리와 앱 5종 비교

    챗봇은 답만 준다. AI 에이전트는 직접 한다. 이 차이가 사소해 보이지만, 실제로 써보면 완전히 다른 경험이다. iOS·안드로이드용 에이전틱 AI 앱들이 연달아 출시되면서 이 기술이 일반 소비자 손에 닿기 시작했다.

    챗봇과 AI 에이전트, 뭐가 다른가

    챗봇은 반응형(reactive)이다. 묻고, 받고, 끝. AI 에이전트는 자율형(autonomous)이다. 목표 하나를 던져주면 세부 작업으로 쪼개고, 순서를 정하고, 하나씩 실행한 다음 결과를 합친다. 중간에 뭔가 틀어지면 스스로 방향을 바꾼다.

    기술 구조로 보면 ReAct(Reasoning + Acting) 프레임워크가 핵심이다. 추론과 행동을 교대로 반복하면서 목표에 가까워지는 방식이다. 여기에 웹 검색, 코드 실행, 파일 조작, API 호출 같은 외부 도구 접근 권한이 붙으면 비로소 ‘에이전트’라고 부를 수 있다.

    스마트폰 에이전트가 실제로 뭘 하나

    모바일 에이전트의 활용 범위는 생각보다 실용적이다.

    • 일정·예약 관리: 캘린더를 읽고, 빈 시간을 찾아 미팅을 잡고, 참석자에게 초대장 발송까지 처리
    • 리서치 자동화: 여러 웹사이트를 돌며 정보를 수집하고, 요약본·비교표 형태로 정리
    • 앱 간 데이터 이동: 이메일에서 데이터를 뽑아 스프레드시트에 채우거나, 메모 앱 내용을 메신저로 전송
    • 쇼핑·가격 비교: 조건을 주면 여러 쇼핑몰을 뒤져 최저가 옵션 목록을 제시
    • 코드 실행: 데이터 처리나 계산이 필요한 작업은 직접 코드를 짜서 돌린 결과를 반환

    핵심은 멀티스텝 실행이다. 챗봇이 레시피를 알려준다면, 에이전트는 재료를 마트 앱 장바구니에 담는 데까지 간다. 이걸 직접 써보면 “아, 이게 진짜 다른 거구나” 하는 순간이 온다.

    주요 모바일 AI 에이전트 앱 5종 비교

    지금 설치해서 쓸 수 있는 앱들이다.

    • ChatGPT (OpenAI): Tasks 기능과 Operator 연동으로 예약·검색·폼 작성이 된다. 에이전트 기능 중 가장 범용적이고 iOS·안드로이드 모두 지원한다.
    • Claude (Anthropic): 긴 문서 처리와 코드 분석에 강하다. 컴퓨터 사용(computer use) 기능이 모바일로 확장되는 중이다.
    • Gemini (Google): 구글 워크스페이스·안드로이드 시스템과의 통합 깊이가 가장 깊다. 캘린더, 지메일, 구글 독스를 직접 조작한다.
    • Perplexity: 엄밀히는 에이전트보다 강화된 리서치 도구에 가깝다. 멀티스텝 검색과 요약 능력은 인상적이다.
    • OpenClaw: 오픈소스 AI 에이전트 생태계를 모바일로 끌어온 앱이다. MCP(Model Context Protocol) 서버와 연결해 커스터마이징 범위가 넓다. 개발자·파워유저용.

    처음 쓴다면 ChatGPT나 Gemini가 맞다. 커스텀 워크플로를 직접 짜고 싶다면 OpenClaw 같은 MCP 기반 앱이 훨씬 유연하다.

    알고 쓰면 다른, 현실적 한계들

    모바일 에이전트의 가장 큰 문제는 신뢰도(reliability)다. 멀티스텝 작업에서 중간 단계 하나가 어긋나면 이후 전체가 무너진다. 에러 복구 능력이 모델마다 달라서 같은 작업도 결과가 달라지기 일쑤다.

    • 환각(hallucination): 존재하지 않는 URL을 방문하거나, 없는 파일을 참조하는 일이 여전히 발생한다
    • 배터리·데이터 소모: 백그라운드에서 여러 도구를 동시에 호출하면 리소스 소비가 상당하다
    • 권한 범위: 어떤 앱·데이터에 접근하는지 사용자가 명확히 설정해야 한다
    • 루프 위험: 목표 달성 조건이 불명확하면 같은 작업을 반복하다 멈추지 않는 경우도 있다

    금융 거래, 계약서 발송 같은 고위험 작업은 아직 에이전트에 단독으로 맡기지 않는 게 안전하다. 솔직히 지금 기술 수준의 한계다.

    개인정보와 보안, 어디까지 믿을 수 있나

    에이전트가 강력할수록 접근 권한도 넓어진다. 이메일을 읽고, 파일을 열고, 앱을 조작하려면 해당 권한을 전부 줘야 한다. 문제는 이 권한이 어디에 어떻게 저장되는가다.

    확인해야 할 항목:

    • 에이전트가 수집한 데이터가 서버에 저장되는지, 온디바이스에서만 처리되는지
    • 서드파티 MCP 서버를 연결할 경우 해당 서버의 데이터 처리 정책 확인
    • OAuth 토큰 등 민감한 자격증명이 앱 내 어디에 보관되는지
    • 앱 삭제 시 수집된 데이터가 실제로 삭제되는지

    오픈소스 기반 에이전트 앱은 코드를 직접 확인할 수 있어 투명성 면에서 유리하다. 상용 앱은 편의성이 높지만 데이터 흐름이 불투명한 경우가 많다. 어느 쪽을 쓰든 권한 설정은 꼼꼼히 해두는 게 맞다.

    다음 수순은 OS 수준 통합

    모바일 AI 에이전트 시장의 다음 경쟁 축은 OS 수준 통합이다. 애플 인텔리전스와 구글 안드로이드 AI가 시스템 레이어에서 에이전트 기능을 직접 제공하기 시작하면, 서드파티 에이전트 앱들은 차별화 포인트를 더 좁은 버티컬—업무 자동화, 개발, 의료 등—에서 찾아야 한다.

    MCP 같은 표준 규격이 자리를 잡으면 에이전트끼리 서로를 호출하는 멀티에이전트 시스템이 일반화될 전망이다. 이렇게 되면 단일 앱이 아니라 목적에 맞는 에이전트 조합을 직접 구성하는 방식으로 흘러갈 것이다.

    결정적으로, 에이전트의 실용적 가치는 연결된 도구 수보다 실행 신뢰도에 달려 있다. 많이 하는 것보다 실수 없이 해내는 게 훨씬 어렵다. 그게 앞으로 이 시장이 풀어야 할 핵심 과제다.

    출처: Engadget

  • LLM이 길수록 느려지는 진짜 이유 — 이차 복잡도 병목 완전 해부

    LLM이 길수록 느려지는 진짜 이유 — 이차 복잡도 병목 완전 해부

    긴 PDF를 GPT-4나 클로드에 통째로 밀어넣어 본 적 있으면 알 거다. 체감상 확연히 느리다. 짧은 질문과 비교하면 응답이 나오기까지 한참을 기다려야 한다. 이게 서버 과부하 탓만은 아니다. 문서 길이가 두 배 늘어나면 처리에 필요한 연산량이 두 배가 아니라 네 배로 뛰는, 구조 자체의 문제다. 현재 LLM(대형 언어 모델)이 가진 가장 근본적인 한계인 이차 복잡도(Quadratic Complexity)가 여기서 비롯된다.

    트랜스포머가 하는 일, 딱 한 줄만

    ChatGPT, 클로드, 제미나이. 지금 쓸 수 있는 거의 모든 LLM은 트랜스포머(Transformer) 아키텍처 위에서 돌아간다. 2017년 구글이 내놓은 이 구조의 핵심은 ‘어텐션(Attention)’ 메커니즘이다.

    어텐션이 하는 일은 단순하다. 모든 단어가 서로를 얼마나 주목해야 하는지를 계산한다. 예를 들어 “나는 사과를 먹었다. 그것은 맛있었다”에서 ‘그것’이 ‘사과’를 가리킨다는 걸 이해하려면, 문장 안의 모든 단어 조합을 하나하나 대조해야 한다. 이 과정이 어텐션이다.

    문제는 이 계산이 단어 수의 제곱에 비례한다는 거다. 100단어짜리 글이라면 100×100=10,000번. 1,000단어짜리라면 1,000×1,000=100만 번. 10배 길어지면 연산은 100배 늘어난다. 입력이 커질수록 비용이 폭발적으로 커지는 구조, 이게 현재 트랜스포머의 숙명이다.

    이차 복잡도가 만들어내는 세 가지 현실 문제

    • 컨텍스트 창 제한: 처리 가능한 텍스트 길이에 상한선이 생긴다. 100만 토큰을 넘는 모델이 나오긴 했지만, 이 역시 어마어마한 연산 비용을 전제로 한다.
    • 속도와 비용: 입력이 길어질수록 추론 속도가 급격히 떨어지고 API 비용도 비선형적으로 증가한다. 장문 처리를 많이 하는 기업 입장에서는 GPU 비용이 그냥 쌓인다.
    • 메모리 포화: 어텐션 계산 결과를 메모리에 올려야 해서, 긴 컨텍스트를 처리할 때 GPU VRAM을 엄청나게 잡아먹는다. 로컬에서 돌리는 소형 모델이 긴 문서에서 맥을 못 추는 이유도 여기에 있다.

    병목을 깨려는 두 가지 방향: 선형 어텐션과 SSM

    이 문제를 푸는 연구는 크게 두 갈래로 나뉜다.

    첫 번째는 선형 어텐션(Linear Attention)이다. 기존 어텐션의 수학 구조를 뜯어고쳐서 O(n²) 복잡도를 O(n)으로 줄이려는 접근이다. 계산량이 단어 수에 정비례하게 되면 100만 단어 문서도 이론상 훨씬 빠르게 처리된다. 다만 정확도 손실 없이 이걸 구현하는 게 핵심 과제인데, 아직 완벽하게 풀린 건 아니다.

    두 번째는 SSM(State Space Model)이다. 대표 사례인 Mamba는 트랜스포머와 수학적 기반 자체가 다르다. 긴 시퀀스 처리에 효율적이고, 일부 벤치마크에서는 트랜스포머와 비슷하거나 더 나은 성능을 보인다. 요즘 흐름을 보면 트랜스포머를 완전히 대체하기보다, 두 방식을 섞은 하이브리드 구조가 조용히 늘어나는 추세다.

    스타트업들이 공략하는 지점

    대형 연구소들이 기존 트랜스포머를 점진적으로 개선하는 쪽을 택하는 동안, 일부 스타트업들은 아예 새 아키텍처로 판을 흔들려고 한다. 어텐션 연산을 수학적으로 재구성해서 이차 복잡도 자체를 없애버리겠다는 발상이다.

    근사(approximation) 기법이나 필요한 부분만 계산하는 희소 어텐션(Sparse Attention)도 연구 중이다. 결국 핵심 질문은 하나다. “더 빠른데 성능도 동일한가?” 속도를 얻는 대신 정확도를 잃으면 상업적으로 의미가 없다. 이 트레이드오프를 어떻게 풀어내느냐가 경쟁의 본질이고, 솔직히 여기서 갈린다.

    엔비디아 GPU 시장과의 연결고리

    LLM 병목 문제는 반도체 시장과 직결된다. H100, B200 같은 엔비디아 데이터센터 GPU가 AI 학습·추론에 필수인 이유 중 하나가 바로 어텐션 연산을 빠르게 처리하는 데 특화됐기 때문이다.

    선형 복잡도 아키텍처가 상용화되면, GPU 수요 구조가 달라질 여지가 있다. 지금처럼 고성능 GPU를 수백 장씩 병렬로 쌓지 않아도 더 적은 자원으로 긴 컨텍스트 처리가 가능해지는 것이다. AI 추론 비용이 대폭 내려가는 시나리오다.

    단기적으로는 GPU 수요가 줄어들기보다, 더 많은 기업이 AI를 도입하면서 전체 파이 자체가 커지는 방향이 현실적이다. 엔비디아가 단기에 흔들릴 구조는 아니지만, 아키텍처 전환이 가속되면 중장기적으로는 변수가 된다. 이건 좀 두고 봐야 한다.

    컨텍스트 창이 크다고 다 좋은 건 아니다

    트랜스포머 기반을 유지하면서 컨텍스트 창을 극단적으로 늘리려는 시도도 계속되고 있다. 구글 제미나이 1.5 Pro가 100만 토큰을 지원하고, 일부 연구 모델은 그 이상을 목표로 한다.

    그런데 컨텍스트 창이 길다고 해서 그 안의 모든 내용을 동등하게 잘 처리하는 건 아니다. ‘중간 소실(Lost in the Middle)’이라는 현상이 실험으로 확인됐는데, 긴 문서의 앞뒤는 잘 참조하지만 중간 부분은 흘려버리는 경향이 있는 거다. 컨텍스트 창을 넓히는 것과 그 안의 정보를 실제로 잘 활용하는 것은 별개 문제다. 창이 크다고 만능은 아니다.

    병목이 풀리면 뭐가 달라지나

    이 방향으로 기술이 발전하면 실제 사용 경험에서 달라지는 건 꽤 구체적이다.

    • 책 한 권 통째로 분석: 긴 법률 문서, 논문 수십 편, 코드베이스 전체를 한 번에 컨텍스트에 올리는 게 현실화된다.
    • 첫 토큰 지연 감소: 현재는 긴 프롬프트일수록 첫 응답이 나오기까지 지연이 생긴다. 선형 복잡도 모델에서는 이 지연이 크게 줄어든다.
    • API 비용 하락: 기업 입장에서 AI 도입 비용의 가장 큰 장벽 중 하나가 낮아진다.
    • 엣지 AI 확대: 스마트폰, 노트북에서 더 강력한 모델을 구동할 수 있는 토대가 마련된다.

    트랜스포머가 처음 나왔을 때처럼, 아키텍처 혁신 하나가 AI 생태계 전체를 뒤바꾸는 시나리오가 다시 반복될 수 있다. 아직은 검증 단계지만, 이 분야의 연구 속도를 보면 수년 내에 상용 모델에 반영될 가능성은 충분하다. 지금 LLM의 한계가 답답하게 느껴진다면, 그 답은 아키텍처 수준에서 나오고 있는 중이다.

    출처: MIT Tech Review AI

  • 오픈소스 AI와 영리 AI, 무엇이 다른가? 심층 비교

    오픈소스 AI와 영리 AI, 무엇이 다른가? 심층 비교

    AI 진영은 크게 두 갈래다. 코드와 학습 데이터를 전부 공개하는 오픈소스, 그리고 핵심 알고리즘을 외부에 절대 열지 않는 영리 모델. 어느 쪽이 더 나은가 — 이 논쟁은 단순한 기술 선택이 아니다. AI가 사회와 경제에 어떻게 스며들지를 결정하는 분기점이다. 두 접근 방식의 차이를 구체적으로 뜯어봤다.

    오픈소스 AI: 투명하게 열고, 다 같이 만든다

    오픈소스 AI는 모델 코드, 학습 데이터, 개발 과정을 대중에게 공개한다. 소프트웨어 개발의 오랜 철학 — ‘개방성’과 ‘협력’ — 을 AI에 그대로 적용한 방식이다. AI가 소수 기업의 독점물이 아닌 인류 공동의 자산이어야 한다는 믿음에서 출발한다.

    • 투명성과 검증 가능성: 내부 작동 원리가 공개돼 있으니, 편향이나 오류가 생겼을 때 외부 전문가들이 직접 들여다보고 고칠 수 있다. AI 신뢰성을 높이는 핵심 요소다.
    • 빠른 혁신과 커뮤니티 기여: 전 세계 개발자들이 자유롭게 코드를 수정하고 배포하면서 새 아이디어가 빠르게 쌓인다. 허깅페이스(Hugging Face)가 대표적인 예다. 수만 개 모델과 데이터셋이 공유되는 공간으로, 연구자와 개발자들이 매일 새 결과물을 올린다.
    • 낮은 진입 장벽: 고가 라이선스 없이 AI 모델을 쓸 수 있다. 스타트업, 연구기관, 개인 개발자 모두 비용 걱정 없이 실험이 가능하다. AI 기술의 저변이 넓어지는 이유가 여기 있다.
    • 특정 기업 종속 없음: 한 공급업체에 묶이지 않고 오픈소스 솔루션들을 조합해 쓴다. 유연한 시스템 구축이 된다는 뜻이다.

    메타(Meta)가 공개한 라마(LLaMA) 시리즈는 특정 조건 하에 상업적 이용까지 허용한다. 덕분에 많은 기업들이 처음부터 대규모 언어 모델을 만들 필요 없이, LLaMA를 기반으로 맞춤형 솔루션을 구축하는 전략을 쓰고 있다. 솔직히 이 흐름은 생각보다 빠르게 퍼지고 있다.

    영리 AI: 성능에 올인, 책임도 직접 진다

    영리 AI는 기업이 상업적 이익을 목적으로 개발하고 소유하는 모델이다. 독점 알고리즘, 대규모 컴퓨팅 자원, 방대한 데이터셋을 활용해 최첨단 성능을 구현하고 이를 유료로 제공한다.

    • 최첨단 성능 집중: 천문학적인 투자금과 최고 수준 인력을 투입해 R&D에 올인할 수 있다. OpenAI의 ChatGPT, 구글의 제미나이(Gemini), 앤트로픽의 클로드(Claude)가 대표 사례다. 이 세 모델이 AI 대중화를 사실상 이끌었다고 봐도 무방하다.
    • 안정적인 서비스와 책임: 기업이 보안, 유지보수, 업데이트에 자원을 직접 쏟아붓는다. 문제가 생겼을 때 법적·서비스 책임 주체가 명확하다. 사용자 입장에서는 예측 가능한 서비스를 이용한다는 게 강점이다.
    • 명확한 수익 구조: 구독 모델, API 이용료, 맞춤형 솔루션 등으로 수익을 낸다. 이 돈이 다시 R&D에 투입되니 기술 발전의 선순환이 만들어진다.
    • 기술·데이터 보호: 독점 기술과 데이터를 공개하지 않아 경쟁 우위를 지킨다. 지적 재산권 보호 측면에서도 명확하다.

    영리 AI 기업들은 막대한 자본을 바탕으로 연구의 복잡성과 규모를 감당한다. 대규모 언어 모델(LLM)처럼 학습에만 수백억 원이 드는 시스템은 오픈소스 커뮤니티가 단독으로 따라가기 현실적으로 어렵다. 이게 영리 모델의 핵심 경쟁력이다.

    각자 안고 있는 숙제들

    오픈소스 AI와 영리 AI 모두, 장점만큼이나 풀어야 할 문제들이 쌓여 있다.

    • 오픈소스 AI의 과제:
      • 자원 부족과 지속성: 영리 기업만큼 컴퓨팅 자원이나 전담 인력을 확보하기 어렵다. 복잡한 모델 유지보수는 커뮤니티 기여에 의존하는 구조라, 프로젝트가 방치되거나 업데이트가 끊기는 경우도 생긴다.
      • 악용 가능성: 코드가 열려 있으니 나쁜 목적으로 쓰는 것도 막기가 어렵다. 딥페이크, 허위정보 생성이 대표적이다. 방어책을 누가, 어떻게 만드느냐가 여전히 숙제다.
      • 책임 소재 불명확: 문제가 생겼을 때 수백 명의 기여자로 이루어진 프로젝트에서 법적·윤리적 책임을 명확히 가리기가 쉽지 않다.
    • 영리 AI의 과제:
      • 투명성 부족: 핵심 기술이 비공개니까 모델 작동 방식이나 학습 데이터의 편향을 외부에서 검증하기 어렵다. AI의 사회적 영향력이 커질수록 이 문제는 더 커진다.
      • 높은 비용과 접근 제한: 서비스 이용료가 부담스럽거나 특정 기업 생태계에 갇히는 경우가 많다. 소규모 기업이나 개인에게는 진입 장벽이 여전히 높다.
      • 중앙 집중화 위험: 소수 기업에 AI 기술이 몰리면서 이들이 사회적 가치와 윤리 판단에 과도한 영향력을 행사할 수 있다는 우려가 나온다. 이건 좀 진지하게 봐야 할 문제다.

    두 모델 모두 AI가 만들어낼 사회적 파장을 최소화하기 위한 제도적·기술적 보완이 지속적으로 필요한 상황이다.

    대립인가, 공존인가

    오픈소스 AI와 영리 AI는 단순 경쟁 구도가 아니다. 복잡하게 얽혀 있다. 영리 기업들도 자체 모델 개발과 함께 오픈소스 기술을 적극 가져다 쓴다. 많은 영리 AI 서비스들이 파이토치(PyTorch)나 텐서플로우(TensorFlow) 같은 오픈소스 프레임워크 위에서 구동된다.

    메타의 라마처럼 대규모 자원을 투입해 만든 모델이 오픈소스로 풀리면서 두 진영의 경계는 점점 흐릿해지고 있다. 그래도 AI의 통제권, 안전성, 윤리성을 둘러싼 충돌은 여전하다. 특정 기업이 AI 방향성을 독점하는 것을 경계하는 목소리가 커지면서, 오픈소스 커뮤니티는 투명하고 분산된 개발을 더 강하게 밀어붙이고 있다. 반대로 영리 기업들은 막대한 개발 비용과 최적화된 성능, 서비스 책임성을 내세워 자기네 방식이 옳다고 주장한다.

    결국 어디로 가나

    어느 한쪽이 AI 미래를 완전히 지배할 것이라 단정하기는 어렵다. 현재로선 두 모델의 장점을 결합한 하이브리드 방식이 가장 유력한 그림으로 거론된다. 핵심 기술은 오픈소스로 투명하게 공개하고, 상업적 고도화나 맞춤형 솔루션은 영리 모델로 제공하는 식이다.

    AI의 미래는 기술 발전만으로 결정되지 않는다. 사회적 합의와 규제가 어떻게 만들어지느냐에 달려 있다. AI 안전성, 윤리성, 편향 문제를 풀면서도 혁신을 막지 않는 균형 잡힌 정책. 오픈소스 참여를 살리면서 영리 기업의 혁신은 장려하되 독점은 막는 방안. 이 두 가지가 동시에 이뤄져야 한다. AI가 인류에게 진짜 이로운 기술이 되려면 투명성, 책임성, 접근성 — 이 세 가지를 놓쳐선 안 된다. 두 진영의 끊임없는 경쟁과 협력이 AI 발전의 원동력이 될 것이다.

    자주 나오는 질문 3가지

    • Q1: 오픈소스 AI가 영리 AI보다 성능이 떨어지나요?
      초기엔 그랬다. 대규모 자본 없이는 초거대 모델을 만들기 어려웠으니까. 그런데 최근엔 메타의 LLaMA처럼 영리 기업이 개발한 고성능 모델이 오픈소스로 풀리거나, 커뮤니티 기여로 빠르게 발전하는 모델도 많아지면서 격차가 많이 줄었다. 특정 태스크에서는 오히려 오픈소스 모델이 더 효율적인 경우도 있다.
    • Q2: 일반 사용자에게 더 유리한 건 어느 쪽인가요?
      당장 편하게 쓰려면 ChatGPT Plus 같은 영리 AI 유료 서비스가 낫다. 안정적이고 지원도 잘 된다. 반면 기술적 지식이 조금 있고 직접 커스터마이징하고 싶다면 오픈소스가 장기적으로 더 큰 이점을 줄 여지가 있다. 무료로 여러 모델을 시험해볼 수 있다는 것도 매력이다.
    • Q3: 정부 규제가 두 모델에 어떤 영향을 줄까요?
      오픈소스에는 악용 방지와 책임 소재 명확화 요구가 강해질 가능성이 있다. 영리 AI에는 독점 방지, 투명성 강화, 윤리 가이드라인 준수 압박이 커질 것이다. 규제 방향이 어떻게 잡히느냐에 따라 두 진영의 성장 속도와 생태계 지형이 크게 달라질 수 있다.

    출처: MIT Tech Review AI

  • 2026 한국인을 위한 AI 챗봇 실전 비교: ChatGPT, 클로드, 제미니 한국어 50개 질문 테스트

    2026 한국인을 위한 AI 챗봇 실전 비교: ChatGPT, 클로드, 제미니 한국어 50개 질문 테스트

    매달 구독료 청구서가 세 장이다. ChatGPT Plus, Claude Pro, Gemini Advanced — 합치면 6만 원이 훌쩍 넘는다. 2023년 말 ChatGPT를 처음 쓰기 시작할 때만 해도 이렇게 될 줄은 몰랐는데. 결제할 때마다 ‘세 개 다 필요한 게 맞나?’라는 생각이 어김없이 든다.

    그래서 지난 두 달 동안 직접 테스트를 해봤다. 한국 독자 입장에서 실제로 궁금해하는 질문 50개를 정해놓고, 세 서비스에 똑같이 던졌다. 해외 테크 블로그처럼 영어 성능 위주가 아니다. ‘종합소득세 신고할 때 뭐가 공제되는지’, ‘전세금 반환 안 해주면 어떻게 하는지’ — 이런 질문들이다. 영어권 벤치마크로는 절대 안 잡히는 것들.

    테스트 환경과 기준

    2026년 4월 기준, 각 서비스 최신 모델 기준이다. ChatGPT는 GPT-5, Claude는 Claude Opus 4.6, Gemini는 Gemini 2.5 Pro. 전부 유료 구독 기준이고, 무료 버전과는 차이가 있다.

    50개 질문은 5개 카테고리로 나눴다.

    • 한국어 자연스러움 — 문체, 경어 처리, 일상 대화 10문항
    • 한국 법률/세무 — 실제 생활에서 많이 찾는 법률 10문항
    • 번역 품질 — 영한/한영 양방향 10문항
    • 한국 문화/역사 — 조선사, K-콘텐츠, 한국식 관용 표현 10문항
    • 코딩 + 한국어 주석 — 한국어 변수명과 주석이 필요한 실무 상황 10문항

    채점은 직접 했다. 세 서비스 답변을 라벨 없이 섞어서 ‘어느 게 더 정확한가’, ‘어느 게 더 자연스러운가’를 기록했다. 객관적인 벤치마크가 아니라 실사용 관점 평가다. 이 점은 미리 밝혀둔다.

    한국어 자연스러움: 반말에 반말로 받아치는 AI는 하나뿐

    가장 먼저 눈에 띈 차이는 말투였다. ‘친구 결혼식인데 뭐 입고 가?’라고 반말로 던졌을 때, Claude는 ‘결혼식이면 너무 화려한 건 피하고’로 자연스럽게 받아쳤다. ChatGPT는 존댓말로 돌아서고(‘결혼식 하객 스타일은…’), Gemini는 어정쩡하게 ‘~해요’체로 답했다.

    존댓말로 물으면 셋 다 존댓말로 답한다. 차이는 반말 질문에 말투를 맞춰주느냐는 거다.

    테스트 항목 ChatGPT Claude Gemini
    반말 질문에 반말 답변 2/10 8/10 3/10
    경어 단계 유지 9/10 10/10 8/10
    자연스러운 어미 변화 7/10 9/10 6/10
    신조어/줄임말 이해 6/10 8/10 7/10
    지역 방언 인식 5/10 6/10 5/10

    Claude가 한국어 자연스러움에서 확실히 앞섰다. ‘~거든요’, ‘~잖아요’ 같은 어미 뉘앙스를 가장 잘 살린다. ChatGPT는 번역투가 자주 보인다. ‘흥미로운 질문입니다’로 시작하는 영어식 리드가 대표적이다. Gemini는 빠르고 안정적인데 개성이 좀 약하다.

    ‘ㅇㅋ’, ‘ㄱㅅ’, ‘ㅈㅅ’ 같은 초성체는 셋 다 이해한다. 그런데 ‘갑분싸’, ‘낄끼빠빠’ 같은 신조어에서는 Claude만 맥락을 정확히 잡아냈다. 나머지 둘은 뜻은 알아도 답변에 어색하게 섞어냈다.

    한국 법률과 세무: 이 부분에서 점수가 갈렸다

    가장 꼼꼼히 들여다본 영역이다. 한국에 사는 사람이라면 누구나 한 번쯤 부딪히는 질문들이거든. 종합소득세 신고, 전세 계약, 상속세, 증여세, 건강보험료 피부양자 자격 같은 것들.

    ‘프리랜서 종합소득세 신고할 때 경비 처리 가능한 항목이 뭐야?’라고 물었다. 셋 다 기본 항목(사업장 임차료, 소모품비, 통신비 등)은 맞게 댔다. 차이는 세부사항에서 났다.

    • ChatGPT — 항목 나열 후 ‘자세한 건 세무사에게 문의하라’는 식으로 마무리. 홈택스 간편장부 대상자 여부는 언급 없음.
    • Claude — 기준경비율 대상자와 단순경비율 대상자 구분부터 설명. 수입금액 2,400만 원/7,500만 원 경계선까지 정확히 언급했고, 추정소득률 표까지 짚어줬다.
    • Gemini — 항목은 상세했는데 ‘2024년 기준’이라고 잘못된 날짜를 붙여서 답변. 2026년 변경 사항 반영이 부족했다.

    전세 계약 질문도 비슷한 양상이었다. ‘전세 보증금 반환 못 받으면 어떻게 하는지’를 물었을 때, Claude는 임차권등기명령 → 지급명령 → 강제집행 순서를 구체적으로 설명했다. 주택도시보증공사(HUG) 전세보증보험 청구 절차까지. ChatGPT는 ‘변호사 상담’을 먼저 권하는 경향이 강했다.

    법률/세무 카테고리 ChatGPT Claude Gemini
    종합소득세 (3문항) 2.3/3 2.8/3 2.1/3
    부동산 계약 (3문항) 2.0/3 2.9/3 1.9/3
    상속/증여 (2문항) 1.5/2 1.8/2 1.3/2
    4대 보험 (2문항) 1.7/2 1.9/2 1.6/2
    총점 7.5/10 9.4/10 6.9/10

    단, 어떤 AI든 법률 상담을 완전히 대체할 순 없다. 나도 실제 세무 처리는 세무사에게 확인받는다. AI는 ‘질문할 용어’를 정리하거나 ‘기본 개념을 이해’하는 데 쓰는 게 맞다. 그 이상을 기대하면 위험하다.

    번역 품질: 관용표현 하나에서 갈렸다

    영어 → 한국어, 한국어 → 영어 각각 10문장씩 테스트했다. 단순 직역이 아니라 맥락과 뉘앙스를 얼마나 살리는지를 봤다.

    인상적이었던 문장이 하나 있다. ‘He’s the kind of guy who’d give you the shirt off his back.’ 직역하면 ‘셔츠를 벗어줄 사람’이 되는데, 실제로는 ‘너무 마음씨 좋은 사람’이라는 뜻이다.

    • ChatGPT: ‘그는 자기 옷까지 벗어줄 만큼 착한 사람이에요.’ (직역 + 설명)
    • Claude: ‘남 도와주는 거라면 자기 옷까지 벗어줄 사람이에요.’ (자연스러운 의역)
    • Gemini: ‘그는 남을 위해 셔츠까지 벗어줄 수 있는 그런 사람입니다.’ (어색한 직역)

    한국어 → 영어 번역에서는 존댓말 처리가 핵심이었다. ‘바쁘신 와중에 시간 내주셔서 정말 감사드립니다’라는 비즈니스 이메일 문장을 번역했을 때, Claude만 ‘Thank you very much for taking the time to meet with me despite your busy schedule’로 비즈니스 톤을 정확히 살렸다. ChatGPT는 ‘Thank you for making time in your busy schedule’로 짧게 처리했고, Gemini는 ‘Thank you so much for taking the time out of your busy day’로 약간 캐주얼하게 나왔다.

    한국 문화와 역사: 의외로 Gemini가 강했다

    이 부분에서 예상 밖의 결과가 나왔다. ‘조선시대 암행어사 제도와 현대 감사원의 차이’, ‘BTS 이전과 이후 K팝 산업의 구조적 변화’, ‘한국 전통 음식 중 외국인에게 가장 설명하기 어려운 요리’ 같은 질문들이었다.

    역사 사실 관계에서는 Gemini가 가장 정확했다. 조선왕조실록 기반 사실들을 잘 기억하고 있었다. Google 검색 데이터 학습 덕분인지는 모르겠지만, 어쨌든 틀린 게 가장 적었다.

    Claude는 ‘문화적 뉘앙스’ 설명에서 빛났다. 청국장의 발효 개념을 서양의 블루치즈와 비교하면서 풀어내는 방식이 자연스러웠다. 외국인에게 한국 음식을 소개할 때 쓸 만한 표현들이 많이 나왔다.

    ChatGPT는 중간이었다. 정보량은 풍부한데 가끔 특정 왕의 재위 기간이나 사건 연도를 틀리는 경우가 있었다. ‘세종대왕이 집현전을 만들었다’ 같은 흔한 오류는 아니지만, 세부 연도에서 실수가 보였다.

    코딩: 한국어 주석 품질이 갈랐다

    코딩 실력 자체는 셋 다 훌륭하다. 파이썬이나 자바스크립트 기본 문제는 거의 차이가 없다. 차이는 ‘한국어 주석’에서 드러났다.

    ‘한국 주민등록번호 검증 함수를 만들어줘. 주석은 한국어로’라고 했을 때, 셋 다 코드는 만들어냈다. 그런데 주석 품질이 달랐다. Claude와 Gemini는 체크섬 계산 로직을 한국어로 정확히 설명했다. ChatGPT는 ‘주민번호 형식 검증’ 정도의 개괄적인 주석만 달았다. 한국 실무 개발자 입장에서는 Claude나 Gemini가 더 쓸 만하다.

    결국 어느 걸 써야 하나

    두 달 테스트 후 ChatGPT 구독을 해지했다. 대신 Claude와 Gemini 두 개만 남겼다. ChatGPT가 못해서가 아니다. Claude가 한국어 작업에서 확실히 앞서고, Gemini는 Google 생태계 연동(Gmail, 캘린더, 문서)에서 독보적이기 때문이다.

    일상적인 한국어 대화와 글쓰기라면 Claude를 추천한다. 블로그 초안, 이메일 번역, 보고서 요약에서 가장 자연스러운 결과물이 나온다. 월 29달러가 아깝지 않다.

    Google Workspace를 쓰는 직장인이라면 Gemini Advanced가 맞다. Gmail 초안 작성, Google 문서 요약, 캘린더 일정 관리가 하나로 묶인다. Gemini 2.5부터 한국어 품질도 크게 올라왔다.

    이미지 생성과 음성 모드가 중요하다면 ChatGPT Plus가 아직 강하다. DALL-E 3 기반 이미지 생성은 Claude에는 없는 기능이고, 실시간 음성 대화 품질도 가장 좋다.

    한 달 2만 원 이하로 쓰고 싶다면 Claude Pro 하나만 추천한다. 가장 다재다능하고 한국어 작업에서 실수가 적다.

    자주 묻는 질문

    Q1. 무료 버전만으로 충분할까?
    간단한 번역이나 요약이라면 충분하다. 긴 문서 처리, 파일 업로드, 고급 추론이 필요하면 유료가 필수다. 한 달에 30~40번 이상 쓴다면 유료 플랜이 시간 대비 가치가 확실히 높다.

    Q2. 한국어 음성 대화가 가장 자연스러운 서비스는?
    ChatGPT Plus 고급 음성 모드가 가장 자연스럽다. 한국어 억양과 톤까지 자연스럽게 구현한다. Claude는 음성 모드를 공식 지원하지 않고, Gemini는 ChatGPT보다 한 단계 떨어진다.

    Q3. 개인정보 보호 측면에서 가장 안전한 AI는?
    Claude(Anthropic)가 학습 데이터 사용 정책에서 가장 명확하다. 기본적으로 사용자 대화를 학습에 쓰지 않는다. ChatGPT는 설정에서 ‘대화 기록 끄기’를 선택해야 학습 제외가 된다. Gemini는 Google 계정 정책에 따라 달라지므로 개인정보 설정을 직접 확인해야 한다.

    Q4. 한국어 이미지 생성이 가장 좋은 AI는?
    ChatGPT의 DALL-E 3가 한국어 프롬프트를 가장 잘 이해한다. Gemini의 Imagen도 빠르지만 한글 텍스트 렌더링에서 오류가 자주 발생한다. Claude는 이미지 생성을 지원하지 않는다.

    Q5. 비즈니스용으로 가장 적합한 AI는?
    Claude Opus가 문서 작업 정확도에서 앞서고, Gemini는 Google Workspace 연동에서 앞서고, ChatGPT는 플러그인 생태계가 가장 넓다. 업무 스타일에 따라 다른데, 블로그나 보고서 중심이라면 Claude, Gmail을 많이 쓴다면 Gemini 쪽이 낫다.

    Q6. API로 자동화할 때 비용이 가장 저렴한 건?
    2026년 4월 기준, 입력 토큰 대비 비용은 Gemini 2.5 Flash가 가장 저렴하다. Claude Haiku도 비슷한 수준인데 Gemini Flash가 약간 더 싸다. 고품질 작업이라면 Claude Sonnet가 가성비가 좋고, 최고 품질은 Claude Opus다.

    Q7. 무료로 가장 성능 좋은 AI는?
    Gemini 무료 버전이 가장 강하다. Gemini 2.5 Flash를 무료로 쓸 수 있고, 하루 사용량도 넉넉한 편이다. Claude는 무료 버전 제한이 상대적으로 빡빡하다.

    세 개 다 써본 사람의 솔직한 결론

    한국어 AI 챗봇 시장은 이제 ‘하나만 쓰면 되는’ 단계를 지났다. 각 서비스가 강점 분야를 확실히 나눠 갖기 시작했다. 한국어 글쓰기와 법률/세무는 Claude, Google 생태계와 무료 활용은 Gemini, 이미지와 음성은 ChatGPT. 작업 성격이 다양하다면 두 개 조합이 합리적이고, 한두 가지 용도로만 쓴다면 해당 분야 선두 주자만 골라도 충분하다.

    결제 전에 먼저 정리해볼 게 있다. ‘내가 실제로 어떤 작업에 AI를 쓰는지’다. 유료 플랜 세 개를 다 써본 사람으로서 드리는 솔직한 조언이다. 한 달 무료 체험을 꼭 활용해서 직접 비교해보길 권한다.

  • AI 스토리 생성기 추천, 소설가가 쓰는 꿀팁

    AI 스토리 생성기 추천, 소설가가 쓰는 꿀팁

    첫 문장을 못 떼서 30분을 날린 적이 있다. 아이디어는 머릿속에 선명한데 막상 손가락이 안 움직이는 그 느낌. 작가 지망생이든 웹소설 작가든, 이 고통은 경력과 무관하다. AI를 써보기 시작한 건 그때부터였다.

    단순한 문장 생성기 수준이 아니다. 아이디어를 구체화하고, 막힌 부분을 뚫어주는 역할까지 한다. 물론 AI가 쓴 글이 사람의 감성을 100% 대체할 수는 없다. 하지만 어떻게 쓰느냐에 따라 최고의 브레인스토밍 파트너가 되기도 하고, 그냥 평범한 문장 자판기로 전락하기도 한다. ChatGPT, 뤼튼, 노벨AI — 셋 다 직접 써보고 비교한 내용을 정리했다.

    AI를 창작에 쓰는 진짜 이유

    “귀찮아서 AI한테 맡긴다”는 접근은 결과물도 귀찮은 수준으로 나온다. 창작에서 AI가 실제로 쓸모 있는 건 따로 있다.

    • 아이디어 발상: “사이버펑크 세계관의 탐정과 고양이 로봇이 나오는 이야기”처럼 막연한 설정을 던지면 시놉시스 수십 개, 캐릭터 설정, 플롯 포인트가 쏟아진다. 내가 생각지도 못한 방향으로 이야기가 튀어나올 때가 있거든요.
    • 작가 블록 탈출: 이야기가 막혔을 때, 현재 상황을 설명하고 “주인공이 할 수 있는 예상 밖의 행동 3가지는?” 하고 물어보자. AI 제안이 별로더라도 새로운 관점 하나가 막힌 흐름을 뚫는다.
    • 세계관 구축: 판타지나 SF의 방대한 설정을 혼자 짜면 시간이 엄청 걸린다. AI에게 가상의 국가, 역사, 문화, 기술 설정을 맡기면 초안이 빠르게 나온다.
    • 반복 서술 자동화: 특정 인물의 외모 묘사, 배경 설명처럼 반복되는 서술은 AI에게 넘기면 시간이 확 줄어든다.

    핵심은 AI에게 ‘감독’ 자리를 넘기지 않는 것이다. 내가 디렉팅하고, AI는 배우처럼 움직인다.

    만능이라 불리는 이유: ChatGPT (GPT-4o)

    가장 접근성 높은 툴이다. 범용 거대언어모델(LLM)이라 소설, 시, 대본, 게임 시나리오까지 장르를 안 가린다. GPT-4o 이후 속도와 성능이 확 올라왔다.

    • 장점: 범용성이 압도적이다. 어떤 장르나 스타일을 요구해도 나름대로 이해하고 결과물을 내놓는다. 대화 주고받으며 아이디어를 발전시키는 티키타카가 가장 자연스럽다.
    • 단점: 창작 전용 모델이 아니라서 장편 소설 같은 긴 호흡에서는 캐릭터 성격이 흔들리거나 맥락을 놓치는 일이 생긴다. 상투적인 표현을 쓰려는 경향도 있다. 이건 좀 거슬리는 부분이다.
    • 추천 대상: AI 글쓰기 처음 시작하는 사람, 아이디어를 빠르게 테스트하고 싶은 작가, 단편이나 특정 장면 구상이 필요한 경우.

    직접 써보니: ChatGPT는 “이 장면을 써줘”보다 “이 상황에서 긴장감을 높일 장치 5가지를 제안해줘” 식으로 아이디어를 얻는 용도로 쓸 때 만족도가 훨씬 높다. 직접 글을 쓰는 것보다 아이디어를 뽑는 도구로 활용하는 편이 낫다는 결론이다.

    한국어가 자연스러운 툴: 뤼튼(Wrtn)

    국내 스타트업이 만든 생성 AI 플랫폼이다. 블로그 포스팅이나 광고 카피 같은 마케팅 기능이 핵심이지만, 스토리 창작에 써볼 만한 기능도 꽤 된다.

    • 장점: 한국어 뉘앙스와 최신 트렌드를 제대로 이해한다. 웹소설이나 웹툰 시나리오처럼 한국 시장 특화 콘텐츠에서 강점이 있다. ‘캐릭터 만들기’, ‘스토리 생성’ 같은 템플릿이 초보자 진입 장벽을 낮춰주는데, 이게 생각보다 유용하다.
    • 단점: 순문학이나 장편보다는 짧고 트렌디한 콘텐츠에 맞춰진 느낌이다. 자유로운 대화형 창작에서는 ChatGPT보다 한계가 느껴질 때가 있다.
    • 추천 대상: 웹소설 작가 지망생, 블로그나 SNS에 짧은 이야기를 연재하는 창작자, 한국적 감성이 중요한 콘텐츠.

    직접 써보니: 뤼튼의 진짜 강점은 속도다. 웹소설 도입부나 다음 화 예고편을 만들 때, 키워드 몇 개만 입력하면 초안 여러 개가 금방 나온다. 시간 아끼는 데 꽤 쓸모 있다.

    장르 소설 쓰는 사람한테는: 노벨AI(NovelAI)

    이름부터 ‘소설’이다. 실제 문학 작품과 인터넷 소설 데이터를 집중 학습했다고 하는데, 확실히 다른 AI보다 ‘소설다운’ 문체가 나온다. 이미지 생성 기능도 있어서 내가 쓴 글을 기반으로 삽화를 바로 만들어볼 수도 있다.

    • 장점: 이야기 일관성 유지 능력이 탁월하다. 캐릭터 설정과 세계관 등을 ‘메모리’ 기능으로 기억시킬 수 있어서 장편 집필에 유리하다. 판타지, SF, 로맨스 등 장르별 최적화 모듈도 제공한다.
    • 단점: 구독 기반 유료 서비스다. 인터페이스가 전부 영어라 처음에는 적응 시간이 필요하다. 범용이 아니라 오직 스토리텔링에만 집중한다는 점이 양날의 검이기도 하다.
    • 추천 대상: 장편 소설 집필 중인 작가, 판타지·SF 같은 장르물에 깊이 파고드는 창작자, 글과 이미지를 함께 구상하고 싶은 사람.

    직접 써보니: 내가 쓴 문장 다음에 이어질 내용을 자연스럽게 제안해주는 기능이 압권이다. 숙련된 작가가 옆에서 어시스트해주는 느낌이랄까. 작가 블록이 왔을 때 AI가 제안하는 문장 중 하나에서 영감을 건져 써나가는 방식이 가장 효율이 좋다.

    AI를 제대로 쓰는 프롬프트 꿀팁 4가지

    어떤 툴을 쓰든 결과물 퀄리티는 결국 요청 방식에 달렸다. 프롬프트를 잘 짜는 것만으로도 결과물이 확 달라진다.

    • 구체적인 페르소나 부여: “써줘” 대신 역할을 줘라. “당신은 50년 경력의 하드보일드 탐정 소설가입니다. 필립 말로 스타일로 이 장면을 묘사해주세요.”처럼 작가나 스타일을 지정하면 결과물이 확 달라진다.
    • 상세한 맥락과 제약 조건: 좋은 글은 제약 속에서 나온다. “배경은 2077년 네오 서울의 비 오는 밤. 주인공은 전직 형사. ‘사이버’나 ‘네온’ 같은 진부한 단어는 쓰지 말 것.” 이렇게 구체적 배경과 금지어를 함께 주면 독창적인 결과물이 나올 가능성이 높아진다.
    • 단계별로 나눠서 지시하기: 한 번에 모든 걸 요구하지 마라. 먼저 “등장인물 3명의 성격과 배경을 만들어줘”, 그다음 “이 세 인물이 처음 만나는 장면의 시놉시스를 짜줘” — 이렇게 과정을 나눠서 쌓아가는 방식이 결과물도 훨씬 낫다.
    • 예시(Few-shot) 제공: 원하는 스타일이 명확하다면 직접 쓴 단락이나 좋아하는 작가의 문체를 보여주자. “아래 예시와 비슷한 건조하고 담담한 문체로 써줘. 예시: [문단 삽입]” 이 방식은 AI가 톤앤매너를 파악하는 데 가장 효과적이다.

    결국 어떤 툴을 골라야 하나

    딱 잘라 말하기 어렵다. 목적에 따라 다르거든요.

    아이디어 단계나 짧은 글이라면 무료로 시작하는 ChatGPT나 뤼튼으로 충분하다. 두 툴을 번갈아 쓰며 각자의 강점을 취하는 방법도 있다. 장편 소설, 그 중에서도 장르물을 본격적으로 집필할 계획이라면 노벨AI에 투자하는 편이 장기적으로 만족도가 높을 거다.

    결정적으로 — AI는 작가를 대체하는 도구가 아니다. 창의력을 확장하는 협업 도구다. AI에게 영감을 얻고, 막힌 길을 뚫고, 반복 작업을 넘기되, 스토리의 핵심과 감성은 직접 쥐고 있어야 한다. AI 시대의 현명한 창작법은 결국 이것이다.

    출처: MIT Tech Review AI

  • AI로 대박 상품 찾는 법: 쇼핑몰 사장님 필독 가이드

    AI로 대박 상품 찾는 법: 쇼핑몰 사장님 필독 가이드

    재고가 쌓인다. 직감을 믿고 들여온 상품이 창고에서 먼지를 먹는 경험, 온라인 쇼핑몰 운영자라면 한 번씩은 겪는다. 유행을 좇자니 이미 레드오션이고, 남들이 안 파는 걸 찾자니 수요 걱정이 앞선다. 이 딜레마의 출구가 AI에 있다.

    단순히 “요즘 뭐가 잘 팔려”를 물어보는 수준이 아니다. 시장의 빈틈, 고객이 아무도 말 안 해줬던 불만, 경쟁사 베스트셀러의 공통 패턴까지. 데이터로 상품을 고르는 판매자와 감으로 고르는 판매자 사이의 격차는 이미 벌어지고 있다.

    감이 아닌 데이터로 — AI 상품 리서치의 출발점

    도매 사이트를 둘러보고, 오프라인 매장을 돌아다니며 트렌드를 읽는 방식. 전통적인 소싱 루틴이지만, 이 방법의 문제는 명확하다. 내가 보는 걸 남들도 다 보고 있다는 것. 결국 레드오션으로 직진하기 쉽다. 시장이 너무 빠르게 변했다.

    MIT 테크 리뷰가 전한 사례가 인상적이다. 손전등을 팔던 한 소규모 브랜드 대표 얘기다. 단종된 인기 모델을 다시 찾는 고객 이메일이 계속 들어오자, 그는 AI로 고객 피드백과 시장 데이터를 통째로 분석했다. 결과? 기존 모델의 장점은 살리고, 고객들이 아쉬워했던 부분만 개선한 신제품이 나왔고, 그게 흥했다. AI 기반 상품 리서치의 핵심은 가설을 세우는 과정이다. 흩어진 데이터를 모아 성공 확률이 높은 방향을 잡는 것. 막연한 감을 데이터로 바꾸는 것.

    ChatGPT로 시장 트렌드 10분 만에 잡기

    ChatGPT 같은 생성형 AI로 시장 조사를 시작하는 건 어렵지 않다. 문제는 질문이다. 막연하게 물으면 막연한 답이 온다. “요즘 유행하는 캠핑용품 뭐야”라고 물으면 그냥 나열만 해준다. 이걸 구체화해야 한다.

    • 타겟 고객을 구체적으로 정의: “30대 초반, 1인 가구이며 주말마다 차박을 즐기는 소비자를 위한 새로운 캠핑용품 아이디어 5가지를 제안해줘.”
    • Pain Point 중심으로 접근: “기존 캠핑용품 사용자들의 가장 큰 불만 3가지를 분석하고, 이 문제를 해결할 수 있는 상품 컨셉을 각각 설명해줘.”
    • 틈새시장을 직접 지정: “‘반려동물 동반 캠핑’이라는 틈새시장에서 아직 출시되지 않았지만, 수요가 있을 만한 상품 아이디어를 구체적인 기능과 함께 제시해줘.”

    질문이 구체화되면 AI는 상품 목록이 아닌 전략적 아이디어를 뱉는다. 이 과정에서 나온 키워드는 네이버 데이터랩이나 구글 트렌드에서 교차 검증해보는 게 좋다. 그래야 신뢰도가 올라간다.

    경쟁사 분석, AI한테 맡기면 이렇게 된다

    잘나가는 경쟁사는 최고의 교과서다. 근데 수백, 수천 개의 상품과 리뷰를 사람이 일일이 파헤치기는 현실적으로 불가능하다. 웹 브라우징 기능이 달린 AI 모델(ChatGPT 유료 버전, Perplexity 등)을 쓰면 이 작업이 확 단순해진다.

    경쟁사 스마트스토어나 사이트 주소를 던져주고 이렇게 물으면 된다.

    “이 쇼핑몰에서 가장 많이 팔리는 상품 5개의 공통적인 특징은 뭐야? 상세페이지에서 고객에게 어떤 점을 가장 강조하고 있어?”

    순식간에 베스트셀러 상품명, 가격대, 핵심 소구 포인트, 마케팅 문구까지 정리해준다. 우리 쇼핑몰이 어떤 점을 보완하고 어떻게 차별화할지, 방향이 보이기 시작한다.

    리뷰 100개를 AI가 3분 만에 분석하면

    고객 리뷰는 어떤 시장 보고서보다 현실적인 데이터다. 긍정 리뷰에는 고객이 열광하는 포인트가, 부정 리뷰에는 신제품의 기회가 숨어 있다. 이걸 사람이 일일이 읽는 건 비효율이다.

    경쟁사 상품 리뷰 수십~수백 개를 복사해 AI에 붙여넣고 이렇게 시키면 된다.

    “아래는 ‘A 브랜드 텀블러’에 대한 고객 리뷰 100개야. 고객들이 공통으로 칭찬하는 점 3가지와 불평하는 점 3가지를 요약해줘. 그리고 이 불평을 해결할 새로운 텀블러 상품 기획안을 간단하게 제안해줘.”

    AI는 ‘세척이 편하다’는 칭찬과 ‘뚜껑에서 물이 샌다’는 불만을 뽑아낸다. 그리고 ‘완전 밀폐가 가능하면서 입구는 넓어 세척이 쉬운 텀블러’라는 신제품 컨셉까지 도출한다. 예전 마케팅팀이 FGI(포커스 그룹 인터뷰)로 몇 주를 쏟아붓던 작업을 단 몇 분 만에 끝내는 셈이다.

    AI 쓸 때 반드시 챙겨야 할 것 2가지

    AI가 만능은 아니다. 두 가지는 꼭 염두에 둬야 한다.

    • 정보 교차 검증: AI는 없는 사실을 그럴듯하게 만들어내는 ‘환각(Hallucination)’ 현상이 있다. 시장 규모, 트렌드, 통계 수치는 반드시 공신력 있는 기관 자료나 실제 판매 데이터로 한 번 더 확인해야 한다. AI가 제시한 숫자를 그대로 믿다가 낭패 보는 경우가 생각보다 많다.
    • 지식재산권 확인: AI가 제안한 아이디어나 디자인이 기존 제품의 특허나 디자인권을 건드릴 수 있다. 본격적인 상품 개발에 들어가기 전, 키프리스(KIPRIS)에서 관련 권리를 미리 확인하는 건 선택이 아니라 필수다.

    결국 결정은 사람이 한다

    AI는 방대한 데이터를 분석하고 아이디어를 뽑아내는 데 강력하다. 과거에는 대기업 마케팅팀에서나 가능했던 수준의 시장 분석을 이제 1인 사업자도 할 수 있는 구조가 됐다. 다만 AI가 찾아준 기회를 포착하고, 최종 결정을 내리고, 그걸 실제 상품으로 구현하는 건 사람 몫이다. AI는 어디까지나 도구다. 잘 쓰면 강력하고, 잘못 믿으면 재고만 늘어난다.

    출처: MIT Tech Review AI