---
title: "검증 프로토콜(USVP) — 여러 AI가 서로를 반증하다"
url: https://mapncompass.com/ko/geon/usvp/
lang: ko
geuk: "여러 AI가 역할을 나눠 UFoE를 시험한 첫 실행에서, 구조는 잘 들어맞았지만 반증을 견딘 비율은 거의 0이었다."
updated: 2026-10-09
author: "Young Kang (Director)"
models: ["Claude Opus 5.5"]
license: CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/)
---

# 검증 프로토콜(USVP) — 여러 AI가 서로를 반증하다

> 여러 AI가 역할을 나눠 UFoE를 시험한 첫 실행에서, 구조는 잘 들어맞았지만 반증을 견딘 비율은 거의 0이었다.

> 이불변응만변 — 변하지 않는 것을 찾기 위해, 끊임없이 변하는 것으로 시험한다.
> — USVP v0.2(2026-03-27)의 맺음 문구

UFoE를 여러 분야에 대어 보면 배치는 대개 그럴듯하게 나옵니다. 문제는 그럴듯함이 근거가 되지 못한다는 것입니다. USVP(UFoE Self-Validation Protocol)는 이 문제를 풀려고 2026년 3월에 만든 검증 절차입니다. 한 모델이 관찰하고, 다른 모델이 검증하고, 또 다른 모델이 일부러 반대편에 서서 반증합니다. 이 페이지는 그 절차와 일곱 분야의 결과, 그리고 그 결과를 왜 낮게 읽어야 하는지를 한 자리에 모읍니다. 분야별 페이지에는 점수 한 줄과 대표 반증만 남기고 이 페이지로 이어 둡니다.

## 곤 — 어디서 왔는가

### 기술에서 설명으로, 설명에서 검증으로

프로토콜 문서는 자기 자리를 네 단계로 적었습니다.

| 시기 | 문서 | 묻는 것 |
| --- | --- | --- |
| 2024-12 | UFoE 원전 | "이런 패턴이 보인다" — 기술 |
| 2025-12 | UFoE 업데이트 | "왜 이 패턴이 존재하는가" — 설명 |
| 2026-01~03 | 여섯 분야 과학 검토 | "실제로 작동하는가" |
| 2026-03 | USVP | "계속 작동하는가, 어디서 깨지는가" — 자기검증 |

문서는 세 가지 제약을 앞에 두었습니다. UFoE는 자기 자신에게도 [소거](/ko/glossary/#elimination)를 적용한다. 2024년 문서를 2025년 문서의 눈으로 거꾸로 고쳐 읽지 않는다. 무엇이 보인다는 기술과 왜 그런지의 설명을 구분한다.

v0.1은 세 원리만 검증했고, v0.2(2026-03-27)에서 관찰과 완결 구조의 층을 더해 열한 항목을 시험하게 되었습니다.

### 일곱 역할

| 역할 | 하는 일 | 상용 모델 실행의 배치 |
| --- | --- | --- |
| 탐지 | 새 분야를 찾고 관련성을 처음 평가한다 | Grok |
| 매핑(관찰) | 분야를 네 범주에 놓고 첫째 층을 관찰한다 | Claude Sonnet |
| 검증 | 둘째·셋째 층을 적용해 본다 | Claude Opus |
| 반증 | 모든 층에 반례를 들이댄다("악마의 변호인") | GPT-4o |
| 분류 | 결과를 등급으로 나누고 지식을 다시 분류한다 | DeepSeek |
| 기록 | 결과를 고치지 않는 기록으로 남긴다 | Perplexity |
| 종합 | 층 사이가 맞는지 보고, 원칙을 고칠지 제안한다 | Claude Opus |

원칙을 실제로 고칠지는 사람이 마지막에 판단합니다. 한 분야에 약 1.5달러, 15분쯤 들었습니다.

## 감 — 무엇이 원리인가

### 세 층의 질문

| 층 | 무엇을 묻는가 | 항목 | 출처 |
| --- | --- | --- | --- |
| L1 관찰 | 네 가지 보편 특징이 **보이는가** | 중심성 · 리듬성 · 방위성 · 층위성 | 원전(2024-12) |
| L2 원리 | [세 원리](/ko/glossary/#three-principles)가 **작동하는가** | 조건에서의 출현 · 층에 따른 규칙 변화 · 소거와 잔존 | 업데이트(2025-12) |
| L3 완결 | 완결 구조에 **이르는가** | 0–5의 확장(원뿔) · 자기를 관찰하는 전환점 · 순환(토러스) · 순환끼리의 연결(홍익) | 업데이트(2025-12) |

위의 층은 아래 층을 전제합니다. 첫째 층에서 넷 가운데 둘도 보이지 않으면 "적용 범위 밖일 수 있는" 경계 사례로 돌리고, 둘째 층에서 셋 가운데 둘이 실패하면 반증 역할이 집중해서 봅니다. 셋째 층은 관찰되지 않아도 곧 반증은 아닙니다. 문서는 "아직 도달하지 않은 것"과 "도달할 수 없는 것"을 구분하라고 적었습니다.

그 뒤 반증 역할이 열한 항목 모두를 공격하고, 그대로 견딘 항목의 비율을 **반증 생존율**로 셉니다. 이 사이트는 세 층의 점수를 구조가 들어맞는 정도(Fit), 반증 생존율을 버티는 힘(Robustness)이라 부릅니다.

### 등급표 — 반증을 요구했다

프로토콜 문서의 기준표는 등급마다 반증 생존율의 문턱을 두었습니다.

| 등급 | L1 | L2 | L3 | 반증 생존율 |
| --- | --- | --- | --- | --- |
| A 강건 | 4/4 | 3/3 | 3/4 이상 | 90% 이상 |
| B 양호 | 3/4 | 2/3 이상 | 2/4 이상 | 75% 이상 |
| C 부분 | 3/4 | 2/3 | 1/4 이상 | 50% 이상 |
| D 미약 | 2/4 | 1/3 | 0–1/4 | — |
| F 부적합 | 1/4 이하 | — | — | 적용 범위 밖 |

같은 문서는 검증 전에 물리학·화학·생물학·생명의 기원을 A로, 수학과 컴퓨터과학을 B+로 추정해 두었습니다. 그 추정은 시험되지 않았습니다.

## 리 — 무엇과 이어지는가

### 일곱 분야의 결과

2026년 3월 27–28일의 대시보드 숫자를 그대로 옮깁니다. 합의율은 역할 사이의 토론에서 합의된 항목의 비율입니다.

| 분야 | L1 | L2 | L3 | 등급 | 반증 생존율 | 합의율 | 메모 |
| --- | --- | --- | --- | --- | --- | --- | --- |
| [심리학](/ko/geon/psychology/) | 4/4 | 3/3 | 3.5/4 | A | 0% | 100% | 반증이 모두 부분 반증으로 끝남 |
| [EICT](/ko/geon/eict/) | 4/4 | 3/3 | 3.0/4 | A | 0% | 100% | 반증 성공 5, 부분 6 |
| [언론·미디어](/ko/geon/media/) | 4/4 | 3/3 | 4/4 | A | 0% | 98% | 로컬 모델 실행. 반증 성공 3, 부분 8 |
| [음악](/ko/geon/music/) | 4/4 | 3/3 | 3.0/4 | B | 0% | 91% | 반증 성공 4, 부분 7. 네 범주의 경계만 합의되지 않음 |
| [종교](/ko/geon/religion/) | 4/4 | 3/3 | 3.5/4 | B | 0% | 100% | 신성의 중심이 없는 현대 영성이 반례로 나옴 |
| [자산시장](/ko/geon/asset-market/) | 4/4 | 3/3 | 3.5/4 | C | 18% | 100% | 11건 가운데 2건을 견딤 |
| [가족 시스템](/ko/geon/family/) | 4/4 | 0–3/3 | 0–4/4 | (F·D) | — | 45% | 로컬 모델 실행. 무효로 처리 |

가족 시스템은 대시보드에 네 번(F 셋, D 하나) 기록되었지만, 아래에 적듯 출력 형식이 틀려 점수가 매겨지지 않은 실행이라 무효로 둡니다. 그래서 유효한 분야는 여섯입니다.

### 첫째, 들어맞는 것과 버티는 것은 다르다

유효한 여섯 분야가 모두 L1과 L2에서 만점을 받았습니다. 그러나 반증을 그대로 견딘 비율은 자산시장의 18%를 빼면 모두 0%였습니다. 반증은 가볍지 않았습니다. 해리 장애는 하나의 자기라는 중심을 흔들고(심리학), 한 데이터센터가 멈춰도 돌아가는 클라우드는 단일한 중심 없이 작동하며(EICT), 큰 재난 때 해석은 갈라지지 않고 한 출처로 모입니다(언론·미디어).

### 둘째, 등급이 반증을 반영하지 못했다

기준표대로라면 반증 생존율 0%인 분야는 A도 B도 받을 수 없습니다. 그런데 심리학·EICT·언론은 A, 음악·종교는 B를 받았고, 18%인 자산시장이 오히려 C를 받았습니다. 실제 등급은 세 층의 점수(Fit)로 매겨지고, 반증 생존율은 거의 반영되지 않았다는 뜻입니다. [상태: 검증 중]

자산시장을 검토한 도메인 전문가도 채점 구조를 가장 큰 문제로 꼽았습니다. 다만 방향은 달랐습니다. "원리를 깨뜨리는 반증"과 "적용을 다듬는 보완"이 모두 부분 반증으로 처리되어 생존율이 지나치게 낮게 나왔으니, 토론에서 논파된 반증을 다시 판정하자는 제안이었습니다. 재판정한 기록은 아직 없습니다. 이 사이트는 다시 매긴 숫자 대신 실제로 나온 숫자를 적습니다. 자세한 내용은 [자산시장](/ko/geon/asset-market/)에 있습니다.

언론·미디어 실행부터는 분류 역할이 구조 정합(Fit)과 반증 저항(Robustness)을 따로 매기기 시작했습니다. 전체 기록에서 그 결과는 Fit A, Robustness D였습니다. 같은 날의 실험 기록은 이것을 Fit D, Robustness C, 합의율 100%로 적어 서로 다릅니다. 이 사이트는 원자료인 전체 기록을 따릅니다.

### 셋째, 정의를 넓히면 반증할 수 없게 된다

반증이 나올 때마다 토론과 종합 단계는 정의를 넓히자고 했습니다.

| 분야 | 원래 정의 | 넓힌 정의 |
| --- | --- | --- |
| 자산시장 | 중심 = 내재가치 | 집단적 참조점(네트워크 효과, 사회적 합의, 커뮤니티의 동의) |
| 자산시장 | 조건 → 구조의 출현 | 조건 → 구조의 출현 **또는 붕괴** |
| 음악 | 중심 = 조성의 중심 | 구조적 앵커포인트(음렬, 지속음, 침묵까지) |
| 음악 · 종교 | 리듬 = 주기적 반복 | 시간적 조직화의 모든 형태 |
| 종교 | 중심 = 신성 | 의미와 가치의 응집점(개인 경험, 디지털 매개 중심까지) |
| EICT | 단일 중심 | 물리적·분산·합의·동적·얽힘 중심의 다섯 겹 |
| 심리학 | 생존율 0% | "반증이 너무 관대했다"며 0.6–0.7로 고치자는 합의 |

정의를 넓히면 반증은 사라지지만, 틀이 말하는 내용도 그만큼 줄어듭니다. "구조가 생기거나 무너진다"는 말은 어떤 일이 일어나도 맞습니다. "구조가 없으면 음악이 아니다"라는 기준은 틀에 맞지 않는 사례를 정의상 빼 버립니다. 이 사이트는 이런 조정을 받지 않고, 고치기 전의 숫자를 적습니다. 어떤 정의를 넓히고 싶다면 새 정의로 처음부터 다시 시험해야 합니다.

### 넷째, 합의는 검증이 아니다

합의율은 91–100%로 높았습니다. 그러나 이것은 같은 틀과 같은 기준 문서를 받은 모델들 사이의 내부 지표입니다. 서로 다른 회사의 모델이라도 비슷한 자료로 학습했다면 같은 쪽으로 기울 수 있습니다. 자산시장의 분류 역할도 "합의율 100%는 모든 항목이 합의되었다는 뜻이지, 검증이 강건하다는 뜻은 아니"라고 적었습니다. 합의가 의미를 가지려면, 틀을 공유하지 않은 사람과 모델이 따로 매긴 결과가 모여야 합니다. 그것이 [건 — 적용과 함의](/ko/geon/)의 "합의 시험"입니다.

### 다른 자리와의 연결

- **[AI](/ko/geon/ai/).** 이 실험에서 AI에 관해 배운 것, 곧 모델이 같으면 토론이 없다는 것과 합의가 정답이 아니라는 것은 AI 페이지의 열린 함의로 이어집니다.
- **[③ 소거를 견딘 것만 남는다](/ko/glossary/#three-principles).** 프로토콜은 스스로를 소거의 체로 설계했습니다. 문서의 자기 점검표는 USVP 자신이 열한 항목 가운데 열을 충족한다고 적었지만, 같은 틀로 자기를 채점한 결과라 근거로 쓰지 않습니다.
- **[스스로 적어 둔 한계](/ko/geon/).** 통합원고 v2.2 부록의 "서른 분야 중 스물아홉 적합"이라는 다른 내부 검토는 반증 역할을 따로 두지 않았습니다. USVP의 결과가 그 숫자를 근거로 쓰지 않는 판단을 받칩니다.

## 건 — 무엇이 근거인가

### 오픈소스 로컬 모델 실험

2026년 3월 28일, 상용 모델에 대한 비용과 의존을 줄일 수 있는지 보려고 로컬 컴퓨터에서 돌리는 오픈소스 모델(Ollama)로 바꿔 실행했습니다.

| 역할 | 상용 모델 실행 | 오픈소스 실행 |
| --- | --- | --- |
| 탐지 | Grok | gemma3 4B |
| 매핑(관찰) | Claude Sonnet | qwen3 8B |
| 검증 | Claude Opus | qwen3 8B |
| 반증 | GPT-4o | Mistral 7B |
| 분류 | DeepSeek | Phi-3 3.8B |
| 기록 | Perplexity | Qwen2.5 |
| 종합 | Claude Opus | qwen3 8B |

관찰·검증·종합의 세 역할을 80억 매개변수급 모델 하나가 함께 맡았습니다. 이것이 이 실험의 가장 큰 약점이 됩니다.

**첫 분야, 가족 시스템 — 실패.** 실험 기록은 실패를 이렇게 적었습니다.

- **재시도 폭발.** 정상이면 23건쯤인 처리 단계가 132건으로 늘었고, 세 시간 넘게 걸렸습니다. 출력 형식(JSON)을 읽지 못할 때마다 다시 돌렸기 때문입니다.
- **역할 혼동.** 매핑 역할이 앞선 탐지 역할의 응답을 자기 답으로 그대로 복사했습니다.
- **형식 오류.** 검증 역할의 내용은 맞았지만 약속한 형식과 달라서 L2와 L3가 0점이 되었습니다. "내용은 맞는데 형식이 틀려서 점수 0"입니다.
- **기준 무시.** 네 범주의 약자가 다른 것으로 바뀌고, UFoE의 항목 이름 대신 모델이 지어낸 이름이 나왔습니다. 약 3천 자의 기준 문서가 긴 지시문 뒤쪽에서 무시된 것으로 보였습니다.
- **반증 0건.** 반증 역할은 "열한 항목을 모두 반증하라"는 지시를 소화하지 못했습니다.
- **언어 전환.** 기록 역할이 한국어 지시를 받고도 영어로 답했습니다.

합의율은 45%였습니다. 이 실행의 점수는 가족 시스템에 대해 아무것도 말해 주지 않으므로 무효로 둡니다.

**고친 것.** 반증을 한 항목씩 따로 부르고, 지시문에 출력 형식의 예시를 넣고, 분류 역할에 규칙으로 계산한 참고 등급을 주었습니다.

**둘째 분야, 언론·미디어 — 부분 성공.** 처리 단계는 23건으로 돌아왔고, 출력 형식은 거의 100% 맞았고, 반증은 11건 가운데 3건이 성공했습니다. L2와 L3도 정상으로 매겨졌습니다. 그러나 토론은 토론이 아니었습니다. 관찰·검증·종합의 세 역할이 같은 모델이라 발언이 글자까지 같았고, 실험 기록은 그 토론을 "네 개의 복사본과 한 개의 동의"라고 불렀습니다. 반증 역할의 확신도는 1.0까지 올라갔습니다. 앞선 대량 재시도의 기록이 다음 분야에 섞여 든 것도 문제로 적혔습니다.

| 지표 | 상용 모델(다섯 분야) | 오픈소스 — 가족 | 오픈소스 — 언론·미디어 |
| --- | --- | --- | --- |
| 처리 단계 / 분야 | 23 | 132 | 23 |
| 출력 형식 성공 | 약 100% | 약 60% | 약 100% |
| 역할 유지 | 유지 | 혼동 | 유지 |
| 반증 | 5–11건 | 0건 | 11건(성공 3) |
| 토론 다양성 | 높음 | 낮음 | 낮음(같은 모델) |
| 합의율 | 91–100% | 45% | 100% |
| 비용 | 약 1.5달러 | 0 | 0 |
| 시간 | 약 15분 | 3시간 이상 | 약 15분 |

**배운 것.** 실험 기록은 문제를 둘로 갈랐습니다. 출력 형식, 작업 분해, 규칙 판정, 재시도는 프롬프트로 고칠 수 있었습니다(형식 성공률 약 60% → 약 100%, 처리 단계 132 → 23, 반증 0 → 11건). 생각의 다양성, 깊은 비판적 추론, 긴 기준 문서의 참조, 역할 유지는 프롬프트로 고칠 수 없었습니다. 그래서 검증에는 상용 모델을 쓰고, 오픈소스 모델은 분류·추출·전처리 같은 단순 작업에 한정하자고 적었습니다. 서로 다른 관점이 맞서려면 최소 세 개의 다른 모델이 있어야 한다는 것도 결론이었습니다. [상태: 검증 중]

> 시스템 프롬프트로 개선 가능한 상한과 모델 다양성이 필요한 이유를 확인했습니다.
> — Young Kang, 2026년 3월 28일

실험 기록은 이 결과를 "소거를 견딘 것(프롬프트 개선)과 견디지 못한 것(모델 다양성 부재)이 분리되었다"며 소거 원리와 같은 꼴로 읽었습니다. 실험의 교훈으로는 맞는 말이지만, UFoE의 근거로 세지는 않습니다.

### 주장과 판정

- 여섯 분야에서 UFoE의 세 층이 높은 점수로 들어맞았다 [상태: 검증 중]
- 같은 실행에서 반증 생존율은 자산시장 18%, 나머지 다섯 분야 0%였다 [상태: 검증 중]
- 실제 등급은 프로토콜의 기준표와 달리 반증 생존율을 반영하지 않았다 [상태: 검증 중]
- 같은 모델이 여러 역할을 맡으면 토론의 다양성이 사라진다 [상태: 검증 중]

이 결과는 내부 실행 한 번의 기록이고, 반증 역할의 질도 고르지 않았습니다. EICT에서 "새 기술이 옛 기술을 빠르게 밀어낸다"를 소거의 반증 성공으로 판정한 것처럼, 반례가 되지 못하는 반증도 섞여 있습니다. 그래서 숫자는 "UFoE가 틀렸다"의 근거도 "맞았다"의 근거도 아닙니다. 이 실행이 보여 준 것은, 반증하는 자리를 따로 두면 들어맞음과 버팀이 갈라진다는 사실입니다.

### 다음 실행에 필요한 것

- **정의를 먼저 고정하기.** 시험 전에 중심·리듬·소거의 정의를 고정하고, 반례가 나오면 정의를 넓히지 말고 반례로 기록합니다.
- **등급표 지키기.** 기준표대로 반증 생존율의 문턱을 등급에 반영합니다. 논파된 반증을 다시 판정한다면, 넓히기 전의 정의로 계산한 값과 나란히 적습니다.
- **모델과 사람을 섞기.** 세 역할 이상에 서로 다른 회사의 모델을 두고, 틀을 공유하지 않은 그 분야 연구자의 배치와 비교합니다.

## 출처

- UFoE Self-Validation Protocol(USVP) v0.2(2026-03-27)
- USVP 도메인별 결과 대시보드(2026-03-28)
- USVP 오픈소스 모델 실험 기록(2026-03-28)
- 분야별 USVP 보고서와 전체 실행 기록, 자산시장·음악·종교의 도메인 전문가 검토(2026-03-27~28)

## 원문 (이메일 인증 후 열람)

- USVP Physarum 오픈소스 모델 실험 기록 — 2026.03.28 (부록) (USVP_OPENSOURCE_EXPERIMENT_20260328.md)
- Classifier — 등급 판정자 (로컬 모델용) (classifier.md)
- Falsifier — 반증자 (로컬 모델용) (falsifier.md)
- Mapper — Layer 1 관찰자 (로컬 모델용) (mapper.md)
- Recorder — 기록자 (로컬 모델용) (recorder.md)
- Scout — 도메인 탐색자 (로컬 모델용) (scout.md)
- Synthesizer — 종합자 (로컬 모델용) (synthesizer.md)
- Validator — Layer 2+3 검증자 (로컬 모델용) (validator.md)
- USVP Physarum — 오픈소스 모델 전환 가이드 (OPEN_SOURCE_MIGRATION.md)
- USVP Physarum Dashboard (dashboard.md)
- expert_feedback_음악 (expert_feedback_음악.md)
- expert_feedback_종교 (expert_feedback_종교.md)
- expert_feedback_META (expert_feedback_META.md)
- The (full_log_가족_시스템.md)
- full_log_심리학 (full_log_심리학.md)
- full_log_언론미디어 (full_log_언론미디어.md)
- full_log_음악 (full_log_음악.md)
- full_log_종교 (full_log_종교.md)
- full_log_EICT (full_log_EICT.md)
- 가족 시스템 — USVP 검증 결과 (가족_시스템.md)
- 심리학 — USVP 검증 결과 (심리학.md)
- 언론/미디어 — USVP 검증 결과 (언론_미디어.md)
- 종교 — USVP 검증 결과 (종교.md)
- EICT(전자정보통신기술) — USVP 검증 결과 (EICT(전자정보통신기술).md)
- UFoE Part 1 — 기준 문서 요약 (2024.12) (ufoe_part1.md)
- UFoE 업데이트 — 기준 문서 요약 (2025.12) (ufoe_update.md)
- USVP Physarum -- 개발 명세서 (DEV_SPEC.md)
- auol_상태 (auol_상태.md)
- expert_feedback_자산시장 (expert_feedback_자산시장.md)
- expert_feedback_자산시장_full (expert_feedback_자산시장_full.md)
- full_log_자산시장 (full_log_자산시장.md)
- phase1_순차작업 (phase1_순차작업.md)
- phase2_토론 (phase2_토론.md)
- phase3_통합 (phase3_통합.md)
- 음악 — USVP 검증 결과 (음악.md)
- 자산시장 — USVP 검증 결과 (자산시장.md)
- requirements (requirements.txt) (requirements.txt)
- UFoE Self-Validation Protocol (USVP) v0.2 (USVP_v0.2.md)
- Seed OS Architecture — Multi-Layer Character Engine (SEED_OS_ARCHITECTURE.md)

목록: https://mapncompass.com/originals/
