합성 영상은 경계에서, 그리고 시간이 흐르면서 무너집니다. 생성 모델은 그럴듯한 표면을 만드는 데는 능하지만 한 물체가 다른 물체와 만나는 자리에서 일관성을 유지하는 데는 약하고, 아무 의미 없는 세부를 1초 뒤에도 똑같이 유지하는 데는 더 약합니다.
여기서 실용적인 방법이 나옵니다. 얼굴을 뚫어져라 보지 말고 가장자리와 연속성을 보세요. 프레임 한 장은 흠잡을 데 없을 수 있습니다. 같은 컷 10초는 대개 그렇지 않습니다.
확인해서 가장 소득이 큰 것은 무엇인가요?
얼마나 눈에 띄는지가 아니라, 얼마나 자주 분명한 답을 주는지 순서로 정리했습니다.
| 확인 항목 | 무엇을 볼 것인가 | 왜 통하는가 |
|---|---|---|
| 손과 손가락 | 손가락을 세어 보고, 손가락이 서로 교차하거나 무언가를 쥐는 장면을 볼 것 | 손은 관절이 많고 스스로를 자주 가림. 일관성을 지키기 가장 어려운 기하 구조 |
| 귀걸이와 장신구 | 양쪽 귀의 비대칭, 모양이 흐르는 현상, 머리카락 뒤로 사라졌다가 다르게 돌아오는 물건 | 작고 단단한 물체에는 강한 사전 지식이 없어 생성 모델이 프레임마다 즉흥적으로 만들어 냄 |
| 배경에 걸친 머리카락 | 실루엣 가장자리의 낱개 머리카락, 배경에 녹아드는 잔머리 | 경계의 미세한 알파 정보는 매팅 오류가 몰리는 자리 |
| 말할 때의 치아와 혀 | 문장 도중에 바뀌는 치아 개수와 모양, 혀의 형태 | 입 안쪽 구조는 프레임마다 새로 만들어지는 일이 잦음 |
| 시간적 일관성 | 같은 컷의 0초, 2초, 4초에서 멈추고 점, 흉터, 문신, 손톱 길이, 천 무늬를 비교 | 구조적 제약이 없는 세부는 유지시킬 힘이 없어 흘러감 |
| 접촉 부위의 피부 | 손이 피부를 누르는 자리, 피부가 천에 닿는 자리 | 접촉에 따른 변형은 모델이 근사만 하는 물리 계산을 요구함 |
| 화면 속 글자 | 간판, 포장, 화면에 얹힌 자막 | 글자는 전형적인 실패 지점. 그럴듯한 글자꼴에 말이 안 되는 단어 |
| 눈에 비친 상 | 양쪽 눈에서 다르게 보이는 캐치라이트, 일관성 없는 반사 | 반사는 존재하지 않는 장면 모델을 필요로 함 |
시간적 일관성 줄이 단일 기법으로는 가장 강력하고 가장 덜 쓰입니다. 같은 컷을 여러 지점에서 멈추고, 구체적이고 아무 의미 없는 세부 하나를 비교하세요. 점의 정확한 모양, 침대 시트의 무늬, 손톱 길이 같은 것들입니다. 카메라는 같은 물체를 기록하지만, 생성 모델은 그것을 매번 새로 발명합니다.
요즘 왜 낱장 프레임에는 속게 되나요?
프레임 단위 품질이야말로 생성 연구가 가장 힘주어 최적화한 부분이고, 정지 이미지에서는 거의 해결되었기 때문입니다.
예전의 단서들 — 밀랍 같은 피부, 기괴할 만큼 완벽한 대칭, 뭉개진 귀 — 은 이전 세대 모델의 흔적입니다. 그것들을 확인하고 없다고 안심하면 근거 없는 확신을 갖게 됩니다. 2026년의 생성물을 2022년의 흔적으로 판단하면 양쪽 방향 모두에서 자신만만하게 틀린 답이 나옵니다.
그만큼 해결되지 않은 것은 지속성입니다. 카메라와 피사체가 움직이는 동안 제약 없는 세부 전부를 수백 프레임에 걸쳐 똑같이 유지하는 일이죠. 남은 증거는 거기에 있습니다.
실제로 일관성은 어떻게 확인하나요?
- 컷이 끊기지 않는 장면 하나를 고릅니다. 컷이 바뀌면 모든 것이 초기화되어 생성 모델에 면죄부를 줍니다.
- 그 컷 안에서 서너 지점에 멈춥니다.
- 구조와 무관한 임의의 세부를 고릅니다. 점, 주근깨 무리, 문신의 가장자리, 천의 프린트, 손톱 모양, 장신구의 줄 같은 것입니다.
- 멈춘 지점들끼리 비교합니다. 진짜 세부는 안정적입니다. 합성된 세부는 흘러가거나, 모양이 바뀌거나, 사라졌다가 다르게 돌아옵니다.
- 프레임의 다른 영역에서 두 번째 세부로 반복합니다. 흔들리는 세부 하나는 압축 탓일 수 있지만, 둘이면 패턴입니다.
- 손이 무언가의 앞을 지나가는 장면을 프레임 단위로 넘겨 봅니다. 가림 경계가 일관성이 가장 눈에 띄게 무너지는 자리입니다.
얼굴 검색으로 영상이 합성인지 알 수 있나요?
직접적으로는 알 수 없습니다. 그리고 무엇을 보탤 수 있고 무엇은 보탤 수 없는지 정확히 말해 두는 것이 중요합니다.
얼굴 검색은 여러분의 프레임을 색인된 얼굴과 비교해 유사도 점수를 돌려줍니다. 거기서 얻는 것은 합성 여부에 대한 판결이 아니라 출처 신호입니다.
- 색인된 실제 배우와 강하게 일치하면 그 얼굴이 실존 인물을 닮았다는 뜻입니다. 이는 정품 발매작과도 양립하고, 다른 영상에 얼굴을 갈아 끼운 경우와도 양립합니다. 질문에 답하는 것이 아니라 좁혀 줄 뿐입니다.
- 일치가 없으면 알려 주는 것이 거의 없습니다. 저희 색인은 106개 사이트에 걸쳐 241,792개의 얼굴을 담고 있고 그중 2,333개가 이름이 확인된 배우와 연결되어 있으며(저희 색인, 2026-08 스냅샷), 그 2,333명 중 2,246명은 대표 이미지가 단일 출처에서 옵니다. 일치가 없다는 것은 합성의 증거이기보다 커버리지나 프레임 품질 문제인 경우가 훨씬 많습니다.
쓸모 있는 조합은 얼굴이 강하게 일치하면서 위의 시간 일관성 검사에서는 실패하는 경우입니다. 그 패턴은 실존 배우의 얼굴이 생성되었거나 바꿔치기된 영상에 얹힌 상황과 들어맞습니다. 이는 동의 없이 이뤄지는 일이므로 심각한 문제입니다.
짚어 둘 한계: 이 확인들 중 어느 것도 증명이 아닙니다. 확률을 옮길 뿐입니다. 눈으로 본 것만으로 합성 여부를 확신한다고 말하는 사람은 증거가 뒷받침하는 것 이상을 주장하고 있는 것입니다.
자동 탐지기는 어떤가요?
그 출력은 판결이 아니라 참고 자료 하나로 다루세요.
탐지기는 특정 생성 모델 계열의 결과물로 학습하고, 그 계열이 바뀌면 정확도를 잃습니다. 게다가 여러분이 실제로 살펴볼 법한 바로 그 자료, 즉 재인코딩되고 크기가 바뀌고 워터마크가 얹힌 영상에서 성능이 떨어집니다. 압축이 탐지기가 의존하는 미세한 통계적 흔적을 지워 버리기 때문입니다. 거짓 양성과 거짓 음성 모두 흔합니다.
얼마나 떨어지는지는 적어도 연구 문헌에서는 측정되어 있습니다. 2025년의 한 컴퓨터 비전 학회와 함께 진행된 독립 블라인드 평가에서, 가장 성적이 좋은 참가 시스템은 손대지 않은 생성 영상에서 0.93 AUC를 기록했고, 일반적인 후처리를 거치자 0.74로, 화면 녹화를 거친 영상에서는 대략 0.62로 떨어졌습니다. 마지막 값은 동전 던지기와 크게 다르지 않습니다. 별도의 연구에서는 학습에 쓴 생성 모델에 대해 96%를 넘던 탐지기가 학습하지 않은 생성 모델에서는 50%대 중반까지 떨어지는 것으로 나타났습니다.
이것들은 통제된 조건에서 평가된 연구용 시스템입니다. 실제로 여러분이 접근할 수 있는 소비자용 "이거 AI인가요?" 도구에 대해서는 독립적으로 재현된 정확도 수치가 아예 없습니다. 상용 영상 탐지기를 포함한 유일한 평가는 계약상 업체명을 익명 처리해야 했는데, 이는 재현 가능성과 정반대입니다. 그래서 이 페이지는 이름이 붙은 어떤 도구에 대해서도 정확도 수치를 인용하지 않으며, 자기 정확도를 스스로 내세우는 도구는 여러분이 확인할 수 있는 것을 아무것도 말해 주지 않은 셈입니다.
출처: SAFE Challenge 영상 부문(ICCV 2025), GenVidBench 및 Deepfake-Eval-2024 평가. 2026-08-03 확인.
이게 단순한 호기심을 넘어 왜 중요한가요?
실존 인물에 대한 비동의 합성물은 실제 피해이고, 사람을 잘못 지목하면 피해가 더 커지기 때문입니다.
어떤 영상이 실존하고 식별 가능한 사람을 담은 것처럼 보이면서 일관성 검사를 통과하지 못한다면, 책임 있는 대응은 검증되지 않은 것으로 두고 재배포하지 않는 것이지 결론을 공표하는 것이 아닙니다. 어떤 영상이 합성이라는 잘못된 지목은 실존 배우에게 피해를 주고, 진짜라는 잘못된 가정은 조작된 묘사를 퍼뜨립니다. 두 오류 모두 반대편에 사람이 있습니다.
관련 질문
- 얼굴 검색은 어떻게 작동하나, 단계별로
- 정식 출처와 불법 복제 출처를 구별하는 법
- 스크린샷 한 장으로 영상을 찾는 법
- 찾는 작품이 왜 안 나오나요?
- 출처를 찾을 때 사람들이 흔히 하는 실수
이 질문에서 출처에 해당하는 절반의 답을 원한다면, 프레임을 여기에 올려 보세요. 그 얼굴이 색인된 배우와 일치하는지 점수와 함께 알려 줍니다. 검출은 브라우저 안에서 돌아가고 원본은 기기를 떠나지 않습니다.