검증 프로토콜(USVP) — 여러 AI가 서로를 반증하다

극 — 한 문장 정의: 여러 AI가 역할을 나눠 UFoE를 시험한 첫 실행에서, 구조는 잘 들어맞았지만 반증을 견딘 비율은 거의 0이었다.

이불변응만변 — 변하지 않는 것을 찾기 위해, 끊임없이 변하는 것으로 시험한다. — USVP v0.2(2026-03-27)의 맺음 문구

UFoE를 여러 분야에 대어 보면 배치는 대개 그럴듯하게 나옵니다. 문제는 그럴듯함이 근거가 되지 못한다는 것입니다. USVP(UFoE Self-Validation Protocol)는 이 문제를 풀려고 2026년 3월에 만든 검증 절차입니다. 한 모델이 관찰하고, 다른 모델이 검증하고, 또 다른 모델이 일부러 반대편에 서서 반증합니다. 이 페이지는 그 절차와 일곱 분야의 결과, 그리고 그 결과를 왜 낮게 읽어야 하는지를 한 자리에 모읍니다. 분야별 페이지에는 점수 한 줄과 대표 반증만 남기고 이 페이지로 이어 둡니다.

곤 — 어디서 왔는가

기술에서 설명으로, 설명에서 검증으로

프로토콜 문서는 자기 자리를 네 단계로 적었습니다.

시기문서묻는 것
2024-12UFoE 원전“이런 패턴이 보인다” — 기술
2025-12UFoE 업데이트“왜 이 패턴이 존재하는가” — 설명
2026-01~03여섯 분야 과학 검토“실제로 작동하는가”
2026-03USVP“계속 작동하는가, 어디서 깨지는가” — 자기검증

문서는 세 가지 제약을 앞에 두었습니다. UFoE는 자기 자신에게도 소거를 적용한다. 2024년 문서를 2025년 문서의 눈으로 거꾸로 고쳐 읽지 않는다. 무엇이 보인다는 기술과 왜 그런지의 설명을 구분한다.

v0.1은 세 원리만 검증했고, v0.2(2026-03-27)에서 관찰과 완결 구조의 층을 더해 열한 항목을 시험하게 되었습니다.

일곱 역할

역할하는 일상용 모델 실행의 배치
탐지새 분야를 찾고 관련성을 처음 평가한다Grok
매핑(관찰)분야를 네 범주에 놓고 첫째 층을 관찰한다Claude Sonnet
검증둘째·셋째 층을 적용해 본다Claude Opus
반증모든 층에 반례를 들이댄다(“악마의 변호인”)GPT-4o
분류결과를 등급으로 나누고 지식을 다시 분류한다DeepSeek
기록결과를 고치지 않는 기록으로 남긴다Perplexity
종합층 사이가 맞는지 보고, 원칙을 고칠지 제안한다Claude Opus

원칙을 실제로 고칠지는 사람이 마지막에 판단합니다. 한 분야에 약 1.5달러, 15분쯤 들었습니다.

감 — 무엇이 원리인가

세 층의 질문

층무엇을 묻는가항목출처
L1 관찰네 가지 보편 특징이 보이는가중심성 · 리듬성 · 방위성 · 층위성원전(2024-12)
L2 원리세 원리가 작동하는가조건에서의 출현 · 층에 따른 규칙 변화 · 소거와 잔존업데이트(2025-12)
L3 완결완결 구조에 이르는가0–5의 확장(원뿔) · 자기를 관찰하는 전환점 · 순환(토러스) · 순환끼리의 연결(홍익)업데이트(2025-12)

위의 층은 아래 층을 전제합니다. 첫째 층에서 넷 가운데 둘도 보이지 않으면 “적용 범위 밖일 수 있는” 경계 사례로 돌리고, 둘째 층에서 셋 가운데 둘이 실패하면 반증 역할이 집중해서 봅니다. 셋째 층은 관찰되지 않아도 곧 반증은 아닙니다. 문서는 “아직 도달하지 않은 것”과 “도달할 수 없는 것”을 구분하라고 적었습니다.

그 뒤 반증 역할이 열한 항목 모두를 공격하고, 그대로 견딘 항목의 비율을 반증 생존율로 셉니다. 이 사이트는 세 층의 점수를 구조가 들어맞는 정도(Fit), 반증 생존율을 버티는 힘(Robustness)이라 부릅니다.

등급표 — 반증을 요구했다

프로토콜 문서의 기준표는 등급마다 반증 생존율의 문턱을 두었습니다.

등급L1L2L3반증 생존율
A 강건4/43/33/4 이상90% 이상
B 양호3/42/3 이상2/4 이상75% 이상
C 부분3/42/31/4 이상50% 이상
D 미약2/41/30–1/4—
F 부적합1/4 이하——적용 범위 밖

같은 문서는 검증 전에 물리학·화학·생물학·생명의 기원을 A로, 수학과 컴퓨터과학을 B+로 추정해 두었습니다. 그 추정은 시험되지 않았습니다.

리 — 무엇과 이어지는가

일곱 분야의 결과

2026년 3월 27–28일의 대시보드 숫자를 그대로 옮깁니다. 합의율은 역할 사이의 토론에서 합의된 항목의 비율입니다.

분야L1L2L3등급반증 생존율합의율메모
심리학4/43/33.5/4A0%100%반증이 모두 부분 반증으로 끝남
EICT4/43/33.0/4A0%100%반증 성공 5, 부분 6
언론·미디어4/43/34/4A0%98%로컬 모델 실행. 반증 성공 3, 부분 8
음악4/43/33.0/4B0%91%반증 성공 4, 부분 7. 네 범주의 경계만 합의되지 않음
종교4/43/33.5/4B0%100%신성의 중심이 없는 현대 영성이 반례로 나옴
자산시장4/43/33.5/4C18%100%11건 가운데 2건을 견딤
가족 시스템4/40–3/30–4/4(F·D)—45%로컬 모델 실행. 무효로 처리

가족 시스템은 대시보드에 네 번(F 셋, D 하나) 기록되었지만, 아래에 적듯 출력 형식이 틀려 점수가 매겨지지 않은 실행이라 무효로 둡니다. 그래서 유효한 분야는 여섯입니다.

첫째, 들어맞는 것과 버티는 것은 다르다

유효한 여섯 분야가 모두 L1과 L2에서 만점을 받았습니다. 그러나 반증을 그대로 견딘 비율은 자산시장의 18%를 빼면 모두 0%였습니다. 반증은 가볍지 않았습니다. 해리 장애는 하나의 자기라는 중심을 흔들고(심리학), 한 데이터센터가 멈춰도 돌아가는 클라우드는 단일한 중심 없이 작동하며(EICT), 큰 재난 때 해석은 갈라지지 않고 한 출처로 모입니다(언론·미디어).

둘째, 등급이 반증을 반영하지 못했다

기준표대로라면 반증 생존율 0%인 분야는 A도 B도 받을 수 없습니다. 그런데 심리학·EICT·언론은 A, 음악·종교는 B를 받았고, 18%인 자산시장이 오히려 C를 받았습니다. 실제 등급은 세 층의 점수(Fit)로 매겨지고, 반증 생존율은 거의 반영되지 않았다는 뜻입니다. 상태: 검증 중

자산시장을 검토한 도메인 전문가도 채점 구조를 가장 큰 문제로 꼽았습니다. 다만 방향은 달랐습니다. “원리를 깨뜨리는 반증”과 “적용을 다듬는 보완”이 모두 부분 반증으로 처리되어 생존율이 지나치게 낮게 나왔으니, 토론에서 논파된 반증을 다시 판정하자는 제안이었습니다. 재판정한 기록은 아직 없습니다. 이 사이트는 다시 매긴 숫자 대신 실제로 나온 숫자를 적습니다. 자세한 내용은 자산시장에 있습니다.

언론·미디어 실행부터는 분류 역할이 구조 정합(Fit)과 반증 저항(Robustness)을 따로 매기기 시작했습니다. 전체 기록에서 그 결과는 Fit A, Robustness D였습니다. 같은 날의 실험 기록은 이것을 Fit D, Robustness C, 합의율 100%로 적어 서로 다릅니다. 이 사이트는 원자료인 전체 기록을 따릅니다.

셋째, 정의를 넓히면 반증할 수 없게 된다

반증이 나올 때마다 토론과 종합 단계는 정의를 넓히자고 했습니다.

분야원래 정의넓힌 정의
자산시장중심 = 내재가치집단적 참조점(네트워크 효과, 사회적 합의, 커뮤니티의 동의)
자산시장조건 → 구조의 출현조건 → 구조의 출현 또는 붕괴
음악중심 = 조성의 중심구조적 앵커포인트(음렬, 지속음, 침묵까지)
음악 · 종교리듬 = 주기적 반복시간적 조직화의 모든 형태
종교중심 = 신성의미와 가치의 응집점(개인 경험, 디지털 매개 중심까지)
EICT단일 중심물리적·분산·합의·동적·얽힘 중심의 다섯 겹
심리학생존율 0%“반증이 너무 관대했다”며 0.6–0.7로 고치자는 합의

정의를 넓히면 반증은 사라지지만, 틀이 말하는 내용도 그만큼 줄어듭니다. “구조가 생기거나 무너진다”는 말은 어떤 일이 일어나도 맞습니다. “구조가 없으면 음악이 아니다”라는 기준은 틀에 맞지 않는 사례를 정의상 빼 버립니다. 이 사이트는 이런 조정을 받지 않고, 고치기 전의 숫자를 적습니다. 어떤 정의를 넓히고 싶다면 새 정의로 처음부터 다시 시험해야 합니다.

넷째, 합의는 검증이 아니다

합의율은 91–100%로 높았습니다. 그러나 이것은 같은 틀과 같은 기준 문서를 받은 모델들 사이의 내부 지표입니다. 서로 다른 회사의 모델이라도 비슷한 자료로 학습했다면 같은 쪽으로 기울 수 있습니다. 자산시장의 분류 역할도 “합의율 100%는 모든 항목이 합의되었다는 뜻이지, 검증이 강건하다는 뜻은 아니”라고 적었습니다. 합의가 의미를 가지려면, 틀을 공유하지 않은 사람과 모델이 따로 매긴 결과가 모여야 합니다. 그것이 건 — 적용과 함의의 “합의 시험”입니다.

다른 자리와의 연결

  • AI. 이 실험에서 AI에 관해 배운 것, 곧 모델이 같으면 토론이 없다는 것과 합의가 정답이 아니라는 것은 AI 페이지의 열린 함의로 이어집니다.
  • ③ 소거를 견딘 것만 남는다. 프로토콜은 스스로를 소거의 체로 설계했습니다. 문서의 자기 점검표는 USVP 자신이 열한 항목 가운데 열을 충족한다고 적었지만, 같은 틀로 자기를 채점한 결과라 근거로 쓰지 않습니다.
  • 스스로 적어 둔 한계. 통합원고 v2.2 부록의 “서른 분야 중 스물아홉 적합”이라는 다른 내부 검토는 반증 역할을 따로 두지 않았습니다. USVP의 결과가 그 숫자를 근거로 쓰지 않는 판단을 받칩니다.

건 — 무엇이 근거인가

오픈소스 로컬 모델 실험

2026년 3월 28일, 상용 모델에 대한 비용과 의존을 줄일 수 있는지 보려고 로컬 컴퓨터에서 돌리는 오픈소스 모델(Ollama)로 바꿔 실행했습니다.

역할상용 모델 실행오픈소스 실행
탐지Grokgemma3 4B
매핑(관찰)Claude Sonnetqwen3 8B
검증Claude Opusqwen3 8B
반증GPT-4oMistral 7B
분류DeepSeekPhi-3 3.8B
기록PerplexityQwen2.5
종합Claude Opusqwen3 8B

관찰·검증·종합의 세 역할을 80억 매개변수급 모델 하나가 함께 맡았습니다. 이것이 이 실험의 가장 큰 약점이 됩니다.

첫 분야, 가족 시스템 — 실패. 실험 기록은 실패를 이렇게 적었습니다.

  • 재시도 폭발. 정상이면 23건쯤인 처리 단계가 132건으로 늘었고, 세 시간 넘게 걸렸습니다. 출력 형식(JSON)을 읽지 못할 때마다 다시 돌렸기 때문입니다.
  • 역할 혼동. 매핑 역할이 앞선 탐지 역할의 응답을 자기 답으로 그대로 복사했습니다.
  • 형식 오류. 검증 역할의 내용은 맞았지만 약속한 형식과 달라서 L2와 L3가 0점이 되었습니다. “내용은 맞는데 형식이 틀려서 점수 0”입니다.
  • 기준 무시. 네 범주의 약자가 다른 것으로 바뀌고, UFoE의 항목 이름 대신 모델이 지어낸 이름이 나왔습니다. 약 3천 자의 기준 문서가 긴 지시문 뒤쪽에서 무시된 것으로 보였습니다.
  • 반증 0건. 반증 역할은 “열한 항목을 모두 반증하라”는 지시를 소화하지 못했습니다.
  • 언어 전환. 기록 역할이 한국어 지시를 받고도 영어로 답했습니다.

합의율은 45%였습니다. 이 실행의 점수는 가족 시스템에 대해 아무것도 말해 주지 않으므로 무효로 둡니다.

고친 것. 반증을 한 항목씩 따로 부르고, 지시문에 출력 형식의 예시를 넣고, 분류 역할에 규칙으로 계산한 참고 등급을 주었습니다.

둘째 분야, 언론·미디어 — 부분 성공. 처리 단계는 23건으로 돌아왔고, 출력 형식은 거의 100% 맞았고, 반증은 11건 가운데 3건이 성공했습니다. L2와 L3도 정상으로 매겨졌습니다. 그러나 토론은 토론이 아니었습니다. 관찰·검증·종합의 세 역할이 같은 모델이라 발언이 글자까지 같았고, 실험 기록은 그 토론을 “네 개의 복사본과 한 개의 동의”라고 불렀습니다. 반증 역할의 확신도는 1.0까지 올라갔습니다. 앞선 대량 재시도의 기록이 다음 분야에 섞여 든 것도 문제로 적혔습니다.

지표상용 모델(다섯 분야)오픈소스 — 가족오픈소스 — 언론·미디어
처리 단계 / 분야2313223
출력 형식 성공약 100%약 60%약 100%
역할 유지유지혼동유지
반증5–11건0건11건(성공 3)
토론 다양성높음낮음낮음(같은 모델)
합의율91–100%45%100%
비용약 1.5달러00
시간약 15분3시간 이상약 15분

배운 것. 실험 기록은 문제를 둘로 갈랐습니다. 출력 형식, 작업 분해, 규칙 판정, 재시도는 프롬프트로 고칠 수 있었습니다(형식 성공률 약 60% → 약 100%, 처리 단계 132 → 23, 반증 0 → 11건). 생각의 다양성, 깊은 비판적 추론, 긴 기준 문서의 참조, 역할 유지는 프롬프트로 고칠 수 없었습니다. 그래서 검증에는 상용 모델을 쓰고, 오픈소스 모델은 분류·추출·전처리 같은 단순 작업에 한정하자고 적었습니다. 서로 다른 관점이 맞서려면 최소 세 개의 다른 모델이 있어야 한다는 것도 결론이었습니다. 상태: 검증 중

시스템 프롬프트로 개선 가능한 상한과 모델 다양성이 필요한 이유를 확인했습니다. — Young Kang, 2026년 3월 28일

실험 기록은 이 결과를 “소거를 견딘 것(프롬프트 개선)과 견디지 못한 것(모델 다양성 부재)이 분리되었다”며 소거 원리와 같은 꼴로 읽었습니다. 실험의 교훈으로는 맞는 말이지만, UFoE의 근거로 세지는 않습니다.

주장과 판정

  • 여섯 분야에서 UFoE의 세 층이 높은 점수로 들어맞았다 상태: 검증 중
  • 같은 실행에서 반증 생존율은 자산시장 18%, 나머지 다섯 분야 0%였다 상태: 검증 중
  • 실제 등급은 프로토콜의 기준표와 달리 반증 생존율을 반영하지 않았다 상태: 검증 중
  • 같은 모델이 여러 역할을 맡으면 토론의 다양성이 사라진다 상태: 검증 중

이 결과는 내부 실행 한 번의 기록이고, 반증 역할의 질도 고르지 않았습니다. EICT에서 “새 기술이 옛 기술을 빠르게 밀어낸다”를 소거의 반증 성공으로 판정한 것처럼, 반례가 되지 못하는 반증도 섞여 있습니다. 그래서 숫자는 “UFoE가 틀렸다”의 근거도 “맞았다”의 근거도 아닙니다. 이 실행이 보여 준 것은, 반증하는 자리를 따로 두면 들어맞음과 버팀이 갈라진다는 사실입니다.

다음 실행에 필요한 것

  • 정의를 먼저 고정하기. 시험 전에 중심·리듬·소거의 정의를 고정하고, 반례가 나오면 정의를 넓히지 말고 반례로 기록합니다.
  • 등급표 지키기. 기준표대로 반증 생존율의 문턱을 등급에 반영합니다. 논파된 반증을 다시 판정한다면, 넓히기 전의 정의로 계산한 값과 나란히 적습니다.
  • 모델과 사람을 섞기. 세 역할 이상에 서로 다른 회사의 모델을 두고, 틀을 공유하지 않은 그 분야 연구자의 배치와 비교합니다.

출처

  • UFoE Self-Validation Protocol(USVP) v0.2(2026-03-27)
  • USVP 도메인별 결과 대시보드(2026-03-28)
  • USVP 오픈소스 모델 실험 기록(2026-03-28)
  • 분야별 USVP 보고서와 전체 실행 기록, 자산시장·음악·종교의 도메인 전문가 검토(2026-03-27~28)

원문 보기

원고를 고치지 않고 옮긴 보관본이며, 이메일 인증 후 열람할 수 있습니다. 이전 판과 다른 원고는 원문 보관소 목록에 있습니다.