국경 감시탑 사망 지도, 데이터는 이렇게 모았다

미국-멕시코 국경 감시탑 주변 사망 지도는 어떻게 만들어졌나. 15개월간 정보공개청구로 텍사스 17개 카운티 기록을 모으고, 포함·배제 기준을 정하고, 4,000페이지 문서에서 좌표를 뽑을 때 클로드를 어디까지 맡겼는지 방법론을 정리했습니다.

작성자

카테고리:

3줄 요약

  • MIT 테크놀로지 리뷰와 Times of San Diego는 15개월간 미국-멕시코 국경 감시탑 주변 사망자를 조사해 첫 종합 지도를 만들었다.
  • 기존 단체 데이터셋을 병합하고 텍사스 17개 카운티 보안관실에 공공기록을 청구해 4,000페이지 넘는 보고서를 확보했다.
  • 분량이 많았던 3개 카운티 기록은 API로 접근한 클로드로 좌표를 추출하고, 배치 단위로 사람이 직접 검증했다.

기록 한 건에 1,300달러. 접수하고 1년이 지나도 감감무소식인 청구. 미국-멕시코 국경 감시탑 주변에서 숨진 사람들의 지도를 만든 이 조사에서, 가장 많은 시간을 잡아먹은 구간은 분석이 아니라 수집과 검증이었습니다. 텍사스 카운티 중 일부는 기록을 내주는 대가로 300~1,300달러를 청구했고요. 데이터 저널리즘이나 공공데이터 기반 리서치를 설계하는 사람 입장에서 보면, 이 프로젝트의 방법론 문서는 읽을 만한 교재에 가깝습니다.

기록이 흩어져 있을 때 데이터셋을 만드는 순서

조사팀의 출발점은 단순한 질문이었습니다. 추적과 검거를 돕기 위해 세운 정부 감시탑 근처에서 왜 그렇게 많은 사람이 숨졌는가. 답하려면 두 가지 위치 정보가 동시에 필요했는데요. 사람이 숨진 지점, 그리고 미국 관세국경보호청(CBP) 감시탑이 어디에 언제 설치됐는지. 분석 대상은 2015년 이후 사례로 잡았습니다. 서로 다른 국경 정책, 행정부, 감시탑 기술 세대를 한 데이터셋 안에서 비교할 수 있게 하려는 설계죠.

데이터셋은 처음부터 새로 만들지 않았습니다. No More Deaths, Humane Borders, Electronic Frontier Foundation 등 기존 단체가 이미 축적해 공개한 데이터셋을 병합하고, 그 위에 열두 곳이 넘는 기관에서 직접 확보한 새 기록을 얹는 방식. 공공데이터 리서치의 일반적인 순서가 여기 그대로 드러납니다. 먼저 이미 존재하는 데이터셋을 모으고, 그다음 빈 구멍을 직접 청구로 메운다. 국경 전체를 처음부터 혼자 수집하려 들었다면 15개월로는 끝나지 않았을 작업이에요.

포함 기준을 세 개로 줄인 이유

한 사례를 분석 대상에 넣을지 판단하는 기준은 세 가지 확인 항목으로 정리됐습니다. 그 사람이 국경을 건너던 중이었다고 볼 수 있는가, 유해가 발견된 장소가 어디인가, 대략 언제 숨졌는가. 이 세 가지가 확인되면 추가 분석으로 넘겼고요.

기준을 적게 세우는 건 느슨함이 아니라 데이터 가용성에 대한 판단입니다. 국경순찰대는 2000년 이후 국경을 건너다 숨진 사람이 1만 명을 넘는다고 추산하는데, 이 수치조차 실제보다 적게 잡힌 것으로 널리 평가됩니다. 유해가 끝내 발견되지 않는 경우가 있고, 발견된 경우에도 기록을 어떻게 처리할지에 대한 전국 단위 규정이 없거든요. 언제·어디서·누가에 대해 공개된 정보의 양은 사례마다 크게 다릅니다. 기준을 더 촘촘히 세웠다면 남는 사례가 거의 없어 지도 자체를 못 그렸을 가능성이 큽니다.

텍사스가 모든 데이터베이스의 빈칸이었던 구조적 이유

기존 사망자 데이터베이스 대부분에서 가장 큰 결손 지역은 텍사스였습니다. 이유는 행정 구조에 있어요. 애리조나에는 기록을 온라인으로 공유하는 이니셔티브가 있고, 뉴멕시코는 주 단위로 사망 조사를 처리합니다. 텍사스는 개별 카운티가 각자 사망 조사를 맡고요. 일부 카운티 기록은 소수의 연구자들이 정리해 둔 것이 있었지만, 종합적이거나 최신인 것은 없었습니다.

조사팀이 지정한 텍사스 카운티는 17곳. Culberson, Jeff Davis, Presidio, Terrell, Val Verde, Kinney, Maverick, Dimmit, Webb, Zapata, Jim Hogg, Starr, Hidalgo, Cameron, Kenedy, Brooks, Duval입니다. 이민자가 숨진 카운티는 더 있지만, 감시탑이 커버하는 지역이 없는 곳은 조사 목적과 무관해 제외했습니다. 조사 질문이 ‘감시탑 근처의 사망’이니 감시탑이 없는 지역은 모집단에서 빠지는 거죠. 대상 범위를 조사 질문에 맞춰 좁힌 판단입니다.

같은 사건을 두 기관이 기록할 때 어느 쪽을 청구하는가

텍사스 카운티에서 지역 사망에 대해 가장 포괄적인 정보를 모으는 주체는 주민 선거로 뽑히는 행정 판사, 즉 치안판사(justice of the peace)입니다. 청구 대상으로는 자연스러운 선택인데, 조사팀은 다른 경로를 택했어요.

치안판사 개인에게 낸 기록 청구는 수년간 진척이 없기도 합니다. 조사팀이 낸 청구 중 일부는 접수 1년이 지나도 처리되지 않은 상태고요. 치안판사 보고서는 필요한 현장·위치 정보를 빼놓는 경우가 있고, 일부 판사는 사망 현장을 아예 방문하지 않고 현장 초동 대응자와 페이스타임으로 사망을 공식 선언하기도 합니다. 위치 데이터가 조사의 핵심인데 위치 정보가 부실한 소스에 매달릴 수는 없었던 셈입니다.

그래서 MIT 테크놀로지 리뷰가 상대한 곳은 17개 카운티의 보안관실이었습니다. 2025년 7월부터 기록 청구를 넣었고요. 보안관실은 사망이 발견됐을 때 현장에 가장 먼저 도착하는 일이 많고, 그 보고서에는 유해가 발견된 위치 정보가 더 자세히 담기는 경향이 있습니다. 대가도 명확합니다. 보안관실 기록에 의존하면 지역 경찰이나 주 경찰이 처리한 사망은 빠지므로, 텍사스 사망자 수는 실제보다 적게 집계돼요. 조사팀은 이 한계를 숨기지 않고 방법론에 명시했습니다.

비용, 지연, 그리고 체크박스 없는 데이터베이스

청구를 넣은 뒤가 더 험했습니다. 기록을 받기까지 거의 매일 사무실에 전화를 넣는 기간이 이어졌고, 그러고도 끝내 받지 못한 곳이 있습니다. 무료로 제공한 곳도 있었고, 300달러에서 1,300달러를 청구한 카운티도 있었고요. 카운티들은 자기 기록이 불완전하다고 경고했습니다. 사무실 이전 중 분실되거나, 손상·폐기되거나, 보안관 교체 과정에서 어디에 뒀는지 알 수 없게 된 기록이 얼마나 되는지 파악되지 않는다는 것.

지연을 키운 결정적 요인은 데이터 구조였습니다. 대부분의 기관은 사망 당시 그 사람이 국경을 건너던 중이었는지 여부를 따로 기록하지 않아요. 다른 상황에 대해서는 훨씬 세밀한 항목을 관리하는 카운티들인데 말이죠. Zapata 카운티 보고서에는 절도 사건에서 보석류가 도난됐는지를 표시하는 체크박스가 있고, Cameron 카운티 보고서에는 침입자가 굴뚝으로 들어왔는지를 표시하는 항목이 있습니다. 이민자 사망을 곧바로 식별할 수단이 없으니 각 사무실은 기록을 손으로 골라내야 했고, 그 과정은 더 느리고 더 비싸고 오류가 나기 쉬웠습니다.

결과적으로 17개 카운티 중 쓸 수 있는 기록을 받은 곳은 14곳. Dimmit과 Duval에서는 아직 기록을 받지 못했고, Maverick은 건당 수수료를 매겨 비용상 감당할 수 없었습니다.

구간 내용 조사팀의 처리
대상 카운티 텍사스 17개 카운티 지정 감시탑 커버리지 없는 카운티는 제외
청구 대상 치안판사 대신 보안관실 위치 정보가 더 상세, 대신 경찰 처리 건 누락
수령 결과 14개 카운티에서 사용 가능 기록 Dimmit·Duval 미수령, Maverick은 비용 문제
비용 무료~1,300달러 일부 카운티는 300~1,300달러 청구
분량 총 4,000페이지 이상, 일부는 수기 문서 대부분 수작업 추출
AI 활용 Kenedy·Webb·Hidalgo 3개 카운티 클로드 API로 좌표 추출 후 배치 수동 검증

4,000페이지에서 좌표를 뽑을 때 AI를 어디까지 맡겼는가

기관들이 보낸 건 사례별 경찰 보고서였고, 총량은 4,000페이지를 넘겼습니다. 일부는 수기로 작성된 문서였고요. 조사팀은 Kenedy, Webb, Hidalgo 카운티를 제외한 나머지에서는 필요한 정보를 사람이 직접 뽑아냈습니다.

대량의 기록을 보낸 이 세 카운티에 대해서만 API로 접근한 앤스로픽의 클로드를 써서 각 사건 보고서를 검토하고 유해 발견 지점의 좌표를 추출했습니다. 그리고 추출 결과를 배치 단위로 나눠 사람이 직접 확인해 AI의 정확도를 검증했고요. 대규모 언어모델을 문서 처리에 쓰는 방식 중에서 방어 가능한 형태가 여기 있습니다. 판단이 아니라 추출에 쓰고, 전량이 아니라 수작업이 물리적으로 불가능한 구간에만 적용하고, 결과를 사람이 표본 검증하며, 방법론에 어디에 썼는지 명시한다. 이 조사에서 AI는 데이터를 해석하지 않았습니다. 보고서에서 좌표를 옮겨 적는 일을 했을 뿐이죠.

기관들은 2025년 7월부터 2026년 2월까지 기록을 순차적으로 보냈는데, 대부분은 자기 기록이 어느 시점까지 반영된 것인지 밝히지 않았습니다. 이 점 역시 데이터의 최신성에 대한 한계로 남습니다.

배제 규칙을 미리 정해두면 분석이 흔들리지 않는다

조사팀은 기관이 이민자 사망으로 판단해 보낸 사례는 기본적으로 신뢰했습니다. 각 사건에 대해 가장 많은 정보를 가진 쪽이 그 기관이니까요. 다만 기록 자체가 다른 정황을 명확히 드러내는 경우, 예컨대 집에서 숨진 것으로 표시된 사례는 제외했습니다.

위치 정확도에 대해서도 선을 그었습니다. 유해가 발견된 지점을 확신할 수 없을 만큼 정보가 부족한 수백 건은 분석에서 빼냈어요. 반대로 좌표가 적혀 있지 않아도 서술이 충분히 구체적이어서 발견 지점을 0.25마일 이내로 특정할 수 있었던 100건 미만은 남겼습니다. 감시탑과의 거리를 따지는 분석에서 위치 오차 허용 범위를 미리 정해두고 그 기준으로 기계적으로 걸러낸 것. 분석을 시작한 뒤에 기준을 만들면 결론에 맞춰 기준이 움직입니다.

텍사스 기관들은 다른 국경 주의 기관들과 비교해 사망 시점 추정이나 유해의 부패 진행 정도에 관한 정보를 훨씬 적게 제공합니다. ‘대략 언제 숨졌는가’라는 포함 기준이 왜 ‘정확히 언제’가 아니었는지가 여기서 설명되죠.

한국에서 공공기록으로 데이터를 모을 때 달라지는 점

한국의 정보공개 제도는 미국의 주·카운티별 분산 구조와 다릅니다. 청구는 정보공개포털(open.go.kr)에서 기관을 지정해 넣는 방식이 기본이고, 공공기관의 정보공개에 관한 법률에 따라 청구를 받은 기관은 원칙적으로 10일 이내에 공개 여부를 결정하며 부득이한 경우 10일 연장이 가능합니다. 미국 사례처럼 1년 넘게 무응답으로 방치되는 구조는 아니고, 비공개 결정에 대해서는 이의신청과 행정심판 경로가 마련돼 있어요. 다만 처리 기간이 법에 정해져 있다는 것과 실제로 원하는 형태의 데이터를 받는다는 것은 다른 문제입니다.

이 조사가 한국 리서처에게 시사하는 부분은 제도 비교보다 방법론 쪽에 있다고 보는 편이 맞습니다. 기관이 어떤 항목을 애초에 기록하지 않으면 그 항목으로는 검색도 집계도 안 된다는 점, 같은 사건을 여러 기관이 각자 기록할 때 어느 기관의 문서가 내가 필요한 필드를 담고 있는지 먼저 확인해야 한다는 점, 특정 기관을 소스로 택하면 그 기관이 다루지 않는 사건이 통째로 빠진다는 점. 어느 나라 행정 기록에서나 작동하는 원리입니다. 한국 기관의 구체적 서식에 어떤 항목이 있는지는 기관과 문서 종류마다 다르므로 실제 청구 전에 해당 기관의 기록 서식을 확인해야 합니다.

확인된 것과 아직 불확실한 것

확인된 사실

  • 조사는 15개월간 진행됐고, MIT 테크놀로지 리뷰와 Times of San Diego의 협업 프로젝트 ‘Dying on Camera’의 일부다.
  • 백악관 자문, 대통령 임명직, 국경순찰대 요원, 검시관, 보안관, 인도주의 단체 자원봉사자, 기술기업 직원 등 45명 이상을 인터뷰했다.
  • 분석 대상 기간은 2015년 이후이며, 감시탑 주변 사망에 대한 첫 종합 지도·분석이다.
  • 텍사스 17개 카운티 보안관실에 2025년 7월부터 기록을 청구해 14곳에서 사용 가능한 기록을 받았다.
  • Kenedy·Webb·Hidalgo 3개 카운티 기록에 대해 클로드 API로 좌표를 추출하고 사람이 배치 단위로 검증했다.
  • 국경순찰대 추산으로 2000년 이후 1만 명 넘게 숨졌으며, 이 수치는 과소집계로 평가된다.

아직 불확실한 것

  • 보안관실 기록만 사용했기 때문에 텍사스 사망자 수는 실제보다 적게 집계된다. 실제 규모는 알 수 없다.
  • 이전·손상·폐기·보안관 교체 과정에서 사라진 기록의 양이 파악되지 않는다.
  • Dimmit과 Duval 카운티 기록은 수령되지 않았고, Maverick 카운티는 비용 문제로 제외됐다.
  • 대부분의 기관이 자기 기록의 반영 시점을 밝히지 않아 데이터의 최신성 범위가 불명확하다.
  • 텍사스 기록은 사망 시점 추정 정보가 부족해 사망 시기의 정밀도가 다른 주보다 낮다.

감시 기술을 검증하려면 감시 대상의 기록부터 필요하다

이 조사의 구조를 뒤집어 보면 한 가지가 드러납니다. 감시탑은 사람의 위치를 정밀하게 파악하기 위해 설치된 장비입니다. 그 장비 주변에서 사람이 숨졌을 때, 그 사람이 어디서 숨졌는지를 확인하려면 기자들이 열두 곳 넘는 기관에 기록을 청구하고, 4,000페이지의 문서를 손으로 뒤지고, 수백 건을 위치 불명으로 폐기해야 했습니다. 기술의 정밀도와 그 기술을 검증할 기록의 정밀도가 같은 방향으로 움직이지 않는다는 점. 이 방법론에서 가장 뚜렷하게 보이는 사실이고, 감시 시스템의 효과나 실패를 따지려는 조사가 어디서 막히는지를 알려주는 지표이기도 합니다.

출처: MIT Tech Review AI

AI리서치팀

AI리서치팀

Daily News Korea AI리서치팀은 인공지능, 머신러닝, 생성형 AI의 최신 동향과 실용적 활용법을 연구합니다. ChatGPT, 클로드, 미드저니 등 AI 도구 비교 분석과 활용 가이드를 제공합니다.