The Single Shot Espresso

Deep Introspection vs Deep Think: AI가 경영 의사결정에 일반적인 답변만 내놓는 이유

글 Hadi Hendrawan

AI가 일반적인 답변만 내놓는다고 누구나 불평합니다. 흔한 설명은 모델에 컨텍스트가 부족하다는 것입니다. 더 좋은 데이터, 더 좋은 프롬프트, 더 좋은 검색을 넣어 주면 그 밋밋함이 사라진다는 이야기입니다. 그러나 Executive Decision Platform(경영 의사결정 플랫폼)을 구축하는 과정에서 저희는 다른 근본 원인을 발견했습니다. 더 나은 컨텍스트로는 고쳐지지 않는 원인입니다. 일반적인 답변은 컨텍스트의 문제가 아닙니다. 수렴의 문제입니다.

이 글은 그 진단을 펼쳐 놓고, AI가 바깥이 아니라 안을 들여다보게 만드는 방식인 Deep Introspection(깊은 내성)을 소개하며, 몇 달 뒤에 등장한, 같은 근본적 베팅의 거의 동시대적 표현이라 할 수 있는 Google의 Gemini Deep Think와 비교합니다. 둘은 겉으로는 운율이 맞지만, 경영 판단에 가장 중요한 한 가지, 즉 외부 정보에 대해서는 정반대의 입장을 취합니다. (이 글은 2025년 5월 LinkedIn에서 처음 제기한 논지를 발전시킨 것입니다.)

AI가 일반적인 답변을 내놓는 이유: 컨텍스트가 아니라 수렴의 문제

훌륭한 의사결정자가 실제로 어떻게 생각하는지에서 시작해 봅시다. 비즈니스 리더에게 문제를 제시하면, 그에게 진짜 실천적 지혜가 있는 한, 그 자극은 하나의 익숙한 트랙만을 따라 내려가지 않습니다. 여러 회로에 동시에 불이 붙습니다. 예상 밖의 회로들입니다. 스포츠에서 가져온 비유, 어렴풋이 기억나는 역사, 전혀 무관한 딜에서 본 패턴 같은 것들입니다. 그런 다음 전전두엽 피질이 그 모든 회로의 출력을 합리화하고, 그 충돌 속에서 AHA moment(아하 순간)가 태어납니다. 합리화 기능을 느슨하게 풀면(여기서의 사고 실험은 psilocybin 아래에서 일어나는 일입니다) 발산은 더욱 넓어집니다.

AI 모델은 바로 이 발산을 잃어버립니다. 답을 만들어 내려면 수많은 가능한 추론 "회로"가 하나의 수렴된 경로로 붕괴해야 합니다. 그 붕괴는 효율적이며, 동시에 일반적인 답변의 직접적인 원천입니다. 출력은 여러 경로의 놀라운 종합이 아니라 그 경로들의 평균이 됩니다. 이것이 무엇을 뜻하는지 주목해 주십시오. 그 일반성은 부족한 컨텍스트와 아무 상관이 없습니다. 모델에 완벽한 컨텍스트를 주더라도 여전히 수렴되고 탈색된 답을 받게 됩니다. 문제는 수렴 그 자체이기 때문입니다.

저희는 이것을 Field Epistemology(장 인식론)라고 부르는 틀로 연구합니다. 하나의 지능이 데이터, 정보, 지식, 지혜를 실제로 어떻게 사용하는가에 관한 것입니다. 대부분의 AI 실무는 이 구분들을 "데이터"로 뭉개 버립니다. 그 렌즈로 보면, 일반적인 출력의 치료법은 뇌가 쓰는 것과 같습니다. 바로 수렴 이전의 발산입니다. 많은 경로를 생성하고, 병렬로 붙잡아 두고, 그런 다음에야 하나의 답으로 합리화해 내려가는 것입니다. 이것은 진정한 agentic AI framework를 떠받치는 것과 같은 발산 우선 원칙입니다. 통제된 탐색이 자신만만한 단일 추측을 이깁니다.

Deep Introspection: Deep Research의 안티테제

대부분의 "deep" AI 기능은 바깥을 봄으로써 답합니다. Deep Research는 수많은 웹 검색을 돌리고, 20~100개의 페이지를 모으고, 그것들을 종합합니다. 인상적이지만 종종 지적 과시주의자가 되어, 결정을 증류해 주기보다 독자를 압도합니다. 그리고 여기에는 아이러니가 있습니다. 모델은 이미 인터넷으로 학습되었는데, 왜 다시 인터넷을 검색하러 내보내는 것일까요? Larry Page는 Google의 궁극적인 버전은 인공지능이라고 말한 적이 있습니다. AI의 궁극적인 버전은, 외부 정보에 손을 뻗기 전에 자신의 내부 기억을 더 잘 검색하는 것일지도 모릅니다.

Deep Introspection은 Deep Research의 안티테제입니다. 웹을 검색하는 대신, 모델 안에 이미 들어 있는 지식을 검색합니다. 사람이 결정하기 전에 자기 마음속의 모든 것을 깊이 성찰하는 방식과 같습니다. 구체적으로, Deep Research가 증거를 검색해 오는 자리에서 Deep Introspection은 증거를 생성합니다. 한 실험(동남아시아 석유가스 정비 셧다운의 안전사고를 조사하는 과제)에서 저희는 과거 사고 사례를 웹에서 긁어 오는 대신, 모델의 내부 지식으로부터 합성 사고 사례를 생성하는 단계를 만들고, 워크플로의 나머지 부분에서 그 사례들 위에서 추론하게 했습니다. 범용 모델(Gemini 2.0 Flash Thinking)로 실행했는데도, 권고안의 품질은 웹을 도는 Deep Research와 비슷한 수준으로 나왔습니다. 여기서 이 에세이 전체의 밑바닥에 놓인 진짜 질문이 떠오릅니다. 외부 정보는 정말로 최종 결정에서 모델을 더 지혜롭게 만드는가, 아니면 그저 참고문헌만 더 그럴듯하게 만드는가?

이것이 Deep Introspection이 구조적 메모리 격차와 직결되는 이유입니다. 매 사이클마다 바깥에서 컨텍스트를 재구성하는 에이전트는 비싸고 얕은 반면, 통제된 내부 지식을 내성하는 에이전트는 더 저렴하고 더 단단히 접지되어 있습니다. 안을 들여다보는 것은 단지 철학적 입장이 아닙니다. 운영 비용에 관한 결정입니다.

Deep Introspection vs Deep Think: 같은 베팅, 정반대의 검색

Google의 Gemini Deep Think는 2025년 8월에 출시되었습니다(그 전에 I/O에서 프리뷰가 있었습니다). 그 핵심 제안은 병렬 사고입니다. 여러 후보 아이디어를 한꺼번에 생성하고, 동시에 붙잡아 두고, 그런 다음 수정하고 결합한 뒤에 결론에 안착하는 것입니다. 이것은 반대편에서 온, 똑같은 수렴 이전의 발산이라는 직관이며, Google조차 같은 은유 계열로 이를 설명합니다("사람들이 다양한 각도를 탐색하고, 해법을 저울질하고, 다듬어 가듯이"). 시간 순서를 보면, 둘은 한쪽이 다른 쪽을 빌린 것이 아니라 같은 아이디어의 독립적이고 거의 동시대적인 표현으로 읽힙니다.

둘은 병에 대해서는 동의하고 치료법에 대해서는 갈라섭니다. 바깥을 보는 기준선인 Deep Research까지 포함해서, 중요한 축들을 따라 비교하면 다음과 같습니다.

Deep Research Deep Think Deep Introspection
어디를 보는가 바깥, 웹을 향해 바깥, 도구와 함께 실행(Google Search, 코드 실행) 안쪽, 모델 자신의 지식
무엇이 발산하는가 수집된 출처들 병렬적인 추론 경로들 합성 증거(내부에서 생성된 사례들)
스택의 어느 층인가 오케스트레이션 + 검색 학습으로 내장된 모델 능력(추론 시점 연산 + 새로운 RL) 오케스트레이션 패턴(범용 모델 위의 Filters)
무엇에 최적화되었는가 커버리지와 폭 기술적 정확성(수학, 코드, 과학) 경영 의사결정을 위한 실천적 판단
지식의 체제 Episteme, 검색된 것 Episteme, 추론된 것 Phronesis, Episteme에서 증류된 것

네 가지 갈림길은 짚어 볼 가치가 있습니다.

  1. 외부 정보에 대한 정반대 입장. Deep Introspection은 웹 검색을 의도적으로 억제하고 내부에서 생성한 사례로 대체합니다. Deep Think는 그 반대입니다. Google Search를 포함한 도구들과 함께 자동으로 실행됩니다. 이 논증 전체가 세워진 바로 그 축(바깥을 볼 것인가, 안을 볼 것인가?)에서, Deep Think는 저희의 제안보다 저희가 반발하는 대상에 더 가깝게 서 있습니다.
  2. 합성 증거 vs 병렬 가설. Deep Introspection의 시그니처 무브는 추론의 재료가 될 합성 데이터를 생성하는 것입니다. Deep Think는 이미 가진 입력 위에서 병렬적인 추론 경로를 생성합니다. 증거의 발산과 추론의 발산, 관련은 있지만 서로 다른 레버입니다.
  3. 스택의 층위. Deep Think는 가중치 안에 구워져 있습니다. 확장된 추론 시점 연산에, 긴 추론 경로에 보상을 주는 강화학습이 더해진 것입니다. Deep Introspection은 워크플로 안에 삽니다. 범용 모델 위에 오케스트레이션되는 노드와 규칙(저희는 이를 Filters라고 부릅니다)입니다. 하나는 모델 안에 살고, 하나는 방법 안에 삽니다.
  4. 목표 출력, 가장 날카로운 지점. Deep Think는 "박사급" 편향과 추론의 천장이 만들어지는 바로 그 수학, 코드, 과학 영역(IMO, LiveCodeBench, Humanity's Last Exam)에 맞춰 튜닝되고 벤치마크됩니다. Deep Introspection은 가치가 개입되고, 시의성이 요구되는 실천적 판단을 겨냥하며, 그런 판단은 그 어떤 벤치마크도 건드리지 못합니다. 닮음은 구조적일 뿐, 목적지는 거의 겹치지 않습니다.

정리하면 이렇습니다. 같은 근본 베팅(병렬성이 단일 경로 수렴을 이긴다), 검색에 대한 정반대 입장, 서로 다른 최종 목표(기술적 정확성 vs 실천적 지혜)입니다. 여기에는 생산적인 아이러니가 있습니다. Deep Think는 발산에 대한 전제를 입증하면서도, 그 처방의 사례로서는 꽤 빈약합니다. 그것은 더 강력한 Episteme 기계이지 Phronesis 기계가 아닙니다. 왜 그 구분이 게임의 전부인지 보려면, 두 가지 앎의 이름을 불러야 합니다.

Episteme vs Phronesis: 경영진에게 실제로 필요한 지식

플랫폼의 이름이 NTRJ Episteme인 데에는 이유가 있습니다. 에페소스의 셀수스 도서관 파사드에는 네 명의 지식의 여신이 서 있습니다. Episteme, Ennoia, Arete, Sophia입니다. Episteme는 정당화된 참인 믿음, 즉 분석이며, 추론 엔진들이 매우 잘하게 되어 가고 있는 바로 그것입니다. 그러나 Nonaka와 Takeuchi는 Humanizing Strategy에서 오늘날의 AI에 대체로 결여된 두 번째 종류의 앎을 가리킵니다. Phronesis, 즉 경험적 지식이자 실천적 지혜, 시의적절하게 신중한 판단을 내리고 가치와 원칙과 도덕의 인도를 받아 행동하는 능력입니다.

이것이 벤치마크가 놓치는 격차입니다. AI는 GPQA Diamond에서 1위를 하고도 Phronesis가 전혀 없을 수 있으며, 경영 의사결정은 거의 전적으로 Phronesis로 굴러갑니다. 제한된 정보로, 시간 압박 아래에서, 재무적 수익만이 아닌 목표들을 향해 최적화하며 내려지는 결정입니다. Nonaka와 Takeuchi는 오래 지속되는 기업들(1,000년 넘게 생존한 일본 기업이 다섯 곳 있으며, 그중에는 서기 578년에 창립된 사찰 건축 회사 곤고구미가 있습니다)이 바로 이런 지혜를 발휘하는 리더들의 기업이며, 단순한 우월한 수익을 넘어 사회에 기여한다는 것을 관찰했습니다.

그래서 Deep Think의 네 가지 갈림길은 하나로 수렴합니다. Deep Think는 기술적 정확성을 겨냥한 Episteme 엔진인 반면, Executive Decision Platform은 Phronesis를 제조해 내야 합니다. Deep Introspection은 그 제조를 위한 하나의 메커니즘입니다. 모델의 내적 성찰을 사용하고, 여기에 의도적인 압박을 더해(한 실험에서 저희는 마지막 단계에 *"추락하는 비행기의 마지막 120초 안에 있다고 상상하라"*는 조건을 걸었습니다) 인간이 이해관계가 걸린 상황에서 해내는 종류의 실천적 종합을 유도하는 것입니다.

Deep Introspection은 Executive Decision Platform 안에서 어떻게 사는가

이 모든 것은 추상이 아닙니다. 플랫폼이 실제로 그렇게 지어져 있습니다. NTRJ Episteme에서 모든 노드는 Filter이고, 모든 Filter에는 두 개의 커넥터가 있습니다. 왼쪽(Cause)과 오른쪽(Effect)입니다. 그것이 두 방향을 만들고, 그 두 방향이 곧 두 종류의 사고입니다.

  • 왼쪽에서 오른쪽은 의사결정의 방향입니다. 더 큰 데이터 덩어리에서 유의미한 신호를 증류하고, 리더의 논리와 규칙을 적용하고, 선택된 출력을 산출합니다. Phronesis는 그 규칙들 안에 심어져 있습니다. 결정이 내려지는 곳이 여기이며, 가공되지 않은 모델 출력이 가장 자주 일반적으로 보이는 곳도 여기입니다.
  • 오른쪽에서 왼쪽은 내성의 방향입니다. 원인과 더 큰 그림과 더 넓은 풍경을 이해하려는 철학적 노력입니다. 더 많은 정보를 요구하고, 결과 뒤의 원인을 파고듭니다. Deep Introspection이 일어나는 곳이 여기이고, Episteme가 증류되는 곳도 여기입니다.

두 방향은 직선이 아니라 순환입니다. 저희가 Episteme의 Phronesis로의 변성이라고 부르는 것입니다. 여유가 있는 시간에 플랫폼은 가능한 한 많은 내부 정보로 내성하여 Episteme를 만들어 냅니다. 그 Episteme를 다시 리더의 규칙에 통과시키면, 제한된 정보로 빠른 결정을 내려야 할 때 쓰이는 Phronesis가 날카로워집니다. 이것은 사전 의사결정 계층인 Horus를 떠받치는 것과 같은 원칙입니다. 결정 이전에 깊이 내성하여, 결정 자체는 접지된 판단으로 내릴 수 있게 하는 것입니다. 그리고 이것은 Sovereign Decision Making의 5가지 법칙(구조화된 의사결정 설계, 통합된 컨텍스트, 추적 가능한 추론, 정렬된 실행, 감사 가능한 임팩트)의 통제를 받으므로, 내부에서 생성된 증거조차 검사 가능하고 책임 가능한 상태로 남습니다.

여기에 어울리는 이미지가 하나 있습니다. NATARAJA는 자연의 혼돈을 리듬으로 바꾸는, 춤추는 시바의 형상입니다. 의사결정 플랫폼은 정보의 혼돈에 대해 같은 일을 합니다. 흐름을 막거나 흐름과 싸우는 것이 아니라, 흐름과 함께 움직이며(춤추며), 발산을 일반적인 결정이 아닌 통제된 결정으로 바꾸는 것입니다.

자율 조직에게 이것이 뜻하는 것

자율성이 확장될수록 안을 들여다보는 일이 왜 중요할까요? 이 작업의 종착점이 자율 조직이기 때문입니다. 점점 더 많은 비율의 결정이 통제된 자율 모드로 돌아가는 기업 말입니다. 조직은 Episteme만 산출하는 에이전트에게 판단을 위임할 수 없습니다. 에이전트가 실천적 결과가 따르는 결정과 행동을 하는 순간, 그들에게는 Phronesis가 필요하고, 그 Phronesis는 추적 가능해야 합니다. Deep Introspection은 내부 지식으로부터 그 판단을 제조하는 방법이고, 플랫폼의 거버넌스는 그것을 책임 가능하게 유지하는 방법입니다. 이 둘이 합쳐질 때 기업은 지혜를 속도와 맞바꾸지 않고도 보조형 결정에서 자율형 결정으로 옮겨 갈 수 있습니다. Agentic AI Governance for Enterprise Boards에서 이사회를 위해 전개한 논증이 바로 그것입니다.

자주 묻는 질문

AI Deep Introspection이란 무엇입니까?

Deep Introspection은 AI가 웹에서 검색해 오는 대신 모델 안에 이미 들어 있는 지식을 검색하게(안쪽으로 성찰하게) 만드는 접근법입니다. 실무에서는 모델의 내부 지식으로부터 합성 사례나 증거를 생성하고 그 위에서 추론합니다. Deep Research의 안티테제라고 불리는 이유가 여기에 있습니다.

AI는 왜 일반적인 답변을 내놓습니까?

답을 산출하려면 수많은 가능한 추론 경로가 하나의 수렴된 경로로 붕괴해야 하고, 수렴된 출력은 그 경로들의 놀라운 종합이 아니라 평균이기 때문입니다. 이것은 컨텍스트의 문제가 아니라 수렴의 문제입니다. 더 좋은 데이터와 프롬프트로는 고쳐지지 않습니다. 치료법은 수렴 이전의 발산입니다. 많은 경로를 병렬로 탐색한 뒤에 합리화해 내려가는 것입니다.

Deep Think와 Deep Research의 차이는 무엇입니까?

Deep Research는 바깥을 봅니다. 웹 검색을 돌리고 많은 출처를 종합합니다. Gemini Deep Think는 자신의 추론 안쪽을 봅니다(병렬 추론 경로를 생성하고 결합합니다). 그러나 여전히 Google Search를 포함한 도구들과 함께 자동으로 실행됩니다. Deep Introspection은 외부 검색을 억제하고 그 대신 내부의 합성 증거를 생성한다는 점에서 둘 모두와 다릅니다.

AI 의사결정에서 Episteme와 Phronesis의 차이는 무엇입니까?

Episteme는 정당화된 참인 믿음입니다. 분석과 기술적 정확성이며, 추론 모델들이 점점 잘하게 되어 가는 것입니다. Phronesis는 실천적 지혜입니다. 신중하고, 시의적절하고, 가치의 인도를 받는 판단입니다. 경영 의사결정은 대부분 Phronesis로 굴러가는데, 그것이야말로 벤치마크에 최적화된 모델들(강력한 Episteme 엔진들)에게 결여된 바로 그것입니다.

결론

일반적인 답변은 보이지 않는 메커니즘, 즉 수렴의 눈에 보이는 증상입니다. Deep Think와 Deep Introspection은 둘 다 그 진단을 받아들이고 둘 다 발산을 처방하지만, Deep Think는 추론을 발산시키고 기술적으로 정확한 답을 위해 바깥을 보는 반면, Deep Introspection은 증거를 발산시키고 실천적으로 지혜로운 답을 위해 안을 봅니다. 하나는 더 나은 Episteme 기계입니다. 다른 하나는 Phronesis를 향해 손을 뻗고 있습니다. 경영 의사결정이 실제로 만들어지는 재료가 바로 그 지식이기 때문입니다.

안을 들여다보는 것이 여러분 자신의 의사결정 품질에 어떤 영향을 주는지, 그리고 여러분의 AI 투자 가운데 어느 것이 결정을 그저 길게 만드는 것이 아니라 실제로 더 지혜롭게 만들고 있는지 확인하고 싶다면, AI Value Realisation Review로 시작하시거나 통제된 파일럿을 요청하십시오. 의사결정 속도, 감사 가능성, 리더십의 확신을 기준으로 측정하는 출발점을 함께 설계해 드리겠습니다.

출처. GPQA: A Graduate-Level Google-Proof Q&A Benchmark (arxiv.org/abs/2311.12022). Nonaka & Takeuchi, Humanizing Strategy (doi.org/10.1016/j.lrp.2021.102070).