- 해킹 대응, 수학적 돌파, 자기개선형 초지능 같은 발표가 쏟아졌지만, 전문가들이 내용을 들여다본 뒤에는 전혀 다른 이야기가 나왔다는 지적이 나온다.
- 팀닛 게브루와 에밀리 벤더는 능력을 부풀릴 상업적 동기가 강하고, 속도와 긴박감이라는 인상 자체가 정책 결정자와 대중의 시선을 돌리는 수단이라고 본다.
- 발표문을 읽을 때는 주체·검증 가능성·재현 조건·이해관계·시차 다섯 가지만 확인해도 과장 상당수가 걸러진다.
발표 당일 기사가 나가고, 전문가 검토는 2~3주 뒤에 붙는다. AI 업계 발표 사이클의 구조가 이렇습니다. 기업이 성과를 대대적으로 알리고, 해킹 관련 사건처럼 잘못을 인정하는 형식을 띤 발표까지 화제를 키우고, 언론이 집중 보도합니다. 실제로 무슨 일이 있었는지 들여다볼 시간을 가진 뒤에야 처음 보도와 다른 그림이 나옵니다. DAIR(분산 AI 연구소) 총괄인 팀닛 게브루와 워싱턴대 언어학 교수 에밀리 벤더가 짚은 지점이 이것입니다. 그 시차 동안 이미 기사 제목과 사람들의 인식은 굳어져 있습니다.
발표와 검증 사이의 시차가 만드는 착시
기술 발표는 거의 예외 없이 발표자가 통제하는 정보만으로 시작합니다. 외부 연구자가 같은 조건을 재현해 보거나, 사건의 로그를 따로 확인하거나, 주장된 수학적 결과를 검토하는 데에는 시간이 걸립니다. 하루 만에 끝나는 일이 아닙니다. 반면 기사는 발표 당일에 나갑니다. 이 비대칭 때문에 독자는 항상 ‘검증 전 버전’을 먼저 읽게 됩니다.
놀라운 주장을 만났을 때 쓸 만한 방법이 하나 있습니다. 그 주장이 틀렸다고 단정하는 대신 ‘이건 아직 검증 전 단계’라는 태그를 붙여두는 것. 부정도 긍정도 아닌 보류 상태. 이렇게 두면 2~3주 뒤 후속 분석이 나왔을 때 자기 인식을 조용히 갱신하기가 훨씬 쉬워집니다.
능력을 부풀릴 동기는 구조적으로 존재한다
게브루와 벤더의 주장에서 가장 실용적인 부분은 동기에 대한 분석입니다. AI 능력을 과대 진술할 강한 상업적 유인이 있다는 것, 그리고 기업들이 퍼뜨리는 속도감과 긴박함이라는 인상 자체가 정책 결정자와 대중의 주의를 다른 데로 돌리는 수단이라는 것입니다.
이 관점이 유용한 이유는 개별 주장의 진위를 판별할 전문 지식이 없어도 적용 가능한 필터라는 데 있습니다. 발표 주체가 그 발표로 무엇을 얻는지를 먼저 봅니다. 투자 유치, 주가, 규제 논의의 방향, 경쟁사 대비 포지셔닝. 이 중 하나라도 걸려 있다면 그 발표는 마케팅 문서의 성격을 함께 가집니다. 기업의 자체 안전 기준 제안도 같은 렌즈로 봅니다. 오픈AI가 자체적인 글로벌 AI 안전 기준을 제안하고 미국이 국제적 논의를 주도하기를 원한다고 밝힌 것도, 규제의 내용과 주도권을 동시에 다루는 움직임으로 읽힙니다.
주장 유형별로 확인 포인트가 다르다
모든 AI 발표를 같은 방식으로 검증할 수는 없습니다. 주장 유형마다 따져야 할 지점이 다릅니다.
| 주장 유형 | 발표 시점에 강조되는 것 | 검증 단계에서 드러나는 것 |
|---|---|---|
| 보안·해킹 사건 | 잘못을 인정하는 형식의 설명, 사건의 규모 | 실제 공격 경로와 모델의 기여도가 설명과 일치하는지 |
| 수학·과학적 돌파 | 난제 해결이라는 서술 | 독립적 재현 여부, 사람의 개입 범위 |
| 자기개선형 초지능 | 가까운 미래라는 시간 압박 | 주장의 근거가 데모인지 측정 결과인지 |
| 시장 지표(앱 순위·주가) | 1위, 최고치 같은 단일 숫자 | 집계 기간과 기준, 제품 품질과의 관계 |
마지막 줄이 특히 현실적입니다. 메타의 AI 에이전트 ‘뮤즈’가 미국 앱스토어에서 챗GPT를 제치고 1위에 올랐고 메타 주가는 13년 만에 최고의 한 달을 향했습니다. 같은 제품에서 심각한 제로데이 취약점이 보고됐고, 아마존은 이 에이전트가 자사 사이트에서 쇼핑하는 것을 차단했습니다. 순위와 주가는 사실입니다. 다만 그 숫자가 제품의 안전성이나 완성도를 증명하지는 않습니다.
발표문을 읽을 때 던질 다섯 가지 질문
실무에서 쓰는 순서대로 정리하면 이렇습니다. 첫째, 이 주장을 누가 했는가. 개발사 본인인지, 이해관계가 없는 제3자인지. 둘째, 검증 가능한 형태인가. 논문·코드·로그처럼 남이 확인할 수 있는 산출물이 함께 나왔는지. 셋째, 어떤 조건에서의 결과인가. 시연 환경과 실사용 환경의 거리. 넷째, 이 발표로 누가 이득을 보는가. 다섯째, 발표 이후 시간이 얼마나 지났는가.
다섯 번째 질문이 앞의 네 개를 대체할 때도 많습니다. 시간이 지나면 어차피 전문가 검토가 붙기 때문입니다. 판단을 미룰 여유가 있는 사안이라면, 나머지 네 질문을 붙잡고 씨름하는 대신 2주를 기다리는 편이 정확도가 높습니다.
덧붙이면, 주장이 ‘능력’에 대한 것인지 ‘지표’에 대한 것인지 구분하는 습관도 도움이 됩니다. AMD가 열두 번째 1조 달러 기업이 되고 주가가 올해 180% 넘게 오른 것은 시장이 AI 칩 수요를 어떻게 보는지를 알려주는 지표이지, 모델의 능력을 알려주는 값이 아닙니다.
AI 에이전트 앱을 깔기 전 점검할 권한 설정
에이전트형 앱은 기존 챗봇과 위험 구조가 다릅니다. 사용자를 대신해 외부 서비스에 접속하고 행동하기 때문에, 취약점이 있으면 피해 범위가 대화창 밖으로 나갑니다. 설치 전후로 권한을 좁혀두는 편이 안전합니다.
아이폰에서는 설정 → 개인정보 보호 및 보안에서 위치, 사진, 연락처 항목을 열어 해당 앱이 들어와 있는지 확인합니다. 설정 → 개인정보 보호 및 보안 → 추적에서 앱 추적 요청 허용을 끄면 광고 식별자 접근이 막힙니다. 개별 앱 권한은 설정 화면 아래쪽의 앱 이름을 눌러 한 번에 볼 수 있습니다. 안드로이드는 설정 → 보안 및 개인정보 보호 → 권한 관리자에서 권한별로 어떤 앱이 접근 중인지 역으로 확인하는 방식이 빠릅니다. 제조사와 OS 버전에 따라 메뉴 이름과 위치가 다릅니다. 해당 항목이 보이지 않으면 설정 내 검색창에 ‘권한’을 입력하는 편이 확실합니다.
결제·쇼핑 연동은 별도로 다룰 문제입니다. 아마존이 특정 에이전트의 접근을 차단한 사례가 보여주듯, 플랫폼 쪽에서 언제든 막을 수 있는 영역이라 에이전트에 결제 수단을 물려두는 구성은 권장하기 어렵습니다.
한국어로 번역돼 들어오는 과정에서 생기는 손실
해외 AI 발표는 국내에 두 단계를 거쳐 들어옵니다. 원문 발표 → 해외 매체 보도 → 국내 번역 기사. 단계를 지날 때마다 조건문과 단서가 떨어져 나가고 단정형만 남는 경향이 있습니다. 원문에 ‘특정 조건에서’라는 제한이 붙어 있어도 국내 제목에는 사라지는 식입니다. 원문 링크를 한 번 열어보는 것만으로 상당 부분 복원됩니다.
규제 흐름도 국내에 그대로 적용되지는 않습니다. 22개국이 배포 전 테스트와 공통 안전 기준을 담당할 새로운 국제기구 설립을 요구했지만 미국과 중국은 이 선언에 참여하지 않았습니다. 한국이 이 선언에 포함되는지, 국내 제도에 어떤 형태로 반영될지는 원문에서 확인되지 않으며, 이 부분은 추측입니다. 텍사스가 전력망 감사를 이유로 신규 데이터센터 허가를 중단하고 캘리포니아가 전력·물 사용 관련 법을 통과시킨 것도 미국 주 단위 조치라, 국내 데이터센터 정책과 직접 연결 짓기는 어렵습니다.
확인된 것과 아직 불확실한 것
확인된 것
- 게브루와 벤더는 해킹, 수학적 돌파, 자기개선형 초지능에 관한 주장들이 전문가 검토 뒤 다른 그림으로 드러났다고 지적한다.
- 능력을 과대 진술할 상업적 유인이 존재하며, 속도·긴박감의 연출이 정책 결정자와 대중의 주의를 돌리는 수단이라는 것이 이들의 주장이다.
- 22개국이 배포 전 테스트와 공통 안전 기준을 위한 국제기구를 요구했고, 미국과 중국은 불참했다.
- 오픈AI는 자체 글로벌 안전 기준을 제안하며 미국의 주도를 원한다고 밝혔다.
- 메타 뮤즈가 미국 앱스토어 1위에 올랐고, 동시에 심각한 제로데이 취약점이 보고됐으며 아마존은 해당 에이전트의 쇼핑 접근을 차단했다.
- AMD는 열두 번째 1조 달러 기업이 됐고 주가는 올해 180% 넘게 올랐다.
아직 불확실한 것
- 문제가 된 개별 주장들이 구체적으로 어느 지점에서 과장됐는지의 세부 내용.
- 제안된 국제기구가 실제로 설립될지, 배포 전 테스트가 어떤 강제력을 가질지.
- 메타 뮤즈의 국내 이용 가능 여부와 취약점 패치 상황.
- 미국 주별 데이터센터 규제가 다른 지역의 정책에 미칠 영향.
기준을 한 문장으로 줄이면
뉴욕타임스 수석 경제 담당 기자 벤 카셀먼은 사람들이 AI 붐에서 느끼는 곤란함을 이렇게 표현했습니다. AI가 성공하면 일자리가 사라지고, 실패하면 경제가 무너져 퇴직연금이 날아가고 일자리도 잃는다는 겁니다. 양쪽 다 나쁜 결말처럼 들리는 이 구도 자체가 긴박감의 산물입니다. 판단을 서두르게 만드는 서사에 끌려가지 않으려면, 발표를 읽는 순간의 감정과 2주 뒤의 사실을 분리해두는 습관이 필요합니다. 놀라운 주장일수록 판단을 늦추는 편이 결과적으로 정확했습니다.

