# 의도적 무지의 아키텍처: 인과적 마스킹과 인공지능의 마음 이론
***Title Translations / タイトル翻訳***
**🇺🇸 English:** The Architecture of Intentional Ignorance: Causal Masking and Theory of Mind (ToM) in Artificial Intelligence
**🇯🇵 日本語:** 意図的無知のアーキテクチャ: 因果的マスキングと人工知能における心の理論(ToM)
---
**About This Research**
이 문서는 AI와의 수백 개 세션 대화 경험을 바탕으로 한 독립 연구이며, **2025년 10월 기준 웹서치**를 통해 수집된 최신 자료를 바탕으로 작성되었습니다.
---
## 초록 (Abstract)
대형 언어모델(Large Language Models, LLMs)은 최근 마음 이론(Theory of Mind, ToM) 과제에서 놀라운 성능을 보이고 있다. Kosinski(2024)는 GPT-4가 75%의 정확도로 거짓 믿음 과제를 통과하여 6세 아동 수준의 ToM 능력을 보인다고 보고했으며, Strachan 등(2024)은 특정 ToM 과제에서 GPT-4가 인간을 능가한다는 것을 Nature Human Behaviour에 발표했다. 본 연구는 이러한 ToM 능력의 출현이 트랜스포머 아키텍처의 핵심 메커니즘인 인과적 마스킹(causal masking)과 어떤 관계를 맺는지 탐구한다. 인과적 마스킹은 현재 토큰이 미래 토큰을 '볼 수 없도록' 차단하는 구조적 제약으로, 일종의 '의도적 무지(willful ignorance)'를 강제한다. 본 논문의 핵심 가설은 다음과 같다: 인과적 마스킹이 만드는 정보 접근의 비대칭성이 일종의 인식론적(epistemic) 제약을 구성하며, 이 제약이 '타자他者가 무엇을 알고 모르는가'를 추론해야 하는 필요성을 구조적으로 생성한다는 것이다. 본 연구는 (1) AI에서 ToM 능력의 실증적 출현, (2) 인과적 마스킹의 수학적·아키텍처적 메커니즘, (3) 정보 비대칭성과 사회인지의 이론적 연결, (4) 기계적 해석가능성(mechanistic interpretability) 연구, (5) 비판적 관점과 대안 가설을 체계적으로 검토한다. 연구 결과, 인과적 마스킹의 순차적 제약이 ToM과 유사한 정보 추적 메커니즘을 요구하지만, 현재의 LLM ToM 능력이 진정한 정신 상태 이해인지 표면적 패턴 매칭인지에 대해서는 학계에 심각한 논쟁이 존재함을 확인했다.
---
## 1. 서론 (Introduction)
### 1.1 연구 배경
인공지능 분야에서 가장 놀라운 최근 발견 중 하나는 대형 언어모델이 명시적으로 훈련되지 않은 사회인지(social cognition) 능력을 보인다는 것이다. 특히 마음 이론—타자가 자신과 다른 믿음, 욕구, 의도, 지식을 가진다는 것을 이해하는 능력—은 인간 사회성의 핵심이지만, 전통적으로 언어 모델의 설계 목표가 아니었다. Premack과 Woodruff(1978)가 침팬지 연구에서 ToM 개념을 처음 제안한 이래, 발달심리학에서는 ToM이 약 4세경에 발달하는 인지적 이정표로 여겨져 왔다.
그러나 2020년대 중반에 이르러, 이 인간 중심적 능력이 순수 텍스트 데이터로 훈련된 신경망에서 자발적으로 출현하기 시작했다. Kosinski(2024)의 획기적인 PNAS 논문은 GPT-4가 75%의 과제를 성공적으로 해결하여 6세 아동 수준에 필적한다고 보고했다. Strachan 등(2024)은 Nature Human Behaviour에 1,907명의 인간 참가자와 여러 LLM을 비교한 연구를 발표하여, GPT-4가 특정 ToM 과제에서 인간을 능가한다는 것을 입증했다.
### 1.2 문제 제기
본 연구는 트랜스포머 아키텍처의 특정 구성 요소—인과적 마스킹—에 주목한다. Vaswani 등(2017)의 "Attention is All You Need"에서 도입된 인과적 마스킹은 디코더의 self-attention 메커니즘에서 현재 위치가 미래 위치를 참조하지 못하도록 하는 제약이다. 이 간단한 메커니즘은 autoregressive 생성을 가능하게 하지만, 근본적인 인식론적 제약을 구성한다: 모델은 전체 컨텍스트를 메모리에 가지고 있으면서도, 처리 과정에서는 부분적으로만 접근할 수 있다.
흥미롭게도, 이러한 정보 접근의 비대칭성은 인간의 ToM이 다루는 핵심 문제와 구조적으로 유사하다. ToM의 본질은 자신과 타자 간의 정보 비대칭을 인식하고 추론하는 것이다. 인과적 마스킹은 유사한 구조를 만든다: 모델의 각 토큰 위치는 '과거 토큰들이 무엇을 알고 있는가'와 '아직 생성되지 않은 미래 토큰들은 무엇을 모르는가'를 암묵적으로 표현해야 한다.
### 1.3 연구 목적 및 의의
본 연구의 핵심 질문: **트랜스포머 아키텍처의 인과적 마스킹이 만들어내는 '의도적 무지' 구조가, AI 언어모델의 마음 이론 능력과 어떠한 관계를 맺는가?**
본 연구의 학술적 의의는 다음과 같다:
**이론적 기여**: 인과적 마스킹이라는 아키텍처적 제약과 사회인지 능력 간의 관계를 최초로 체계적으로 탐구하여, AI의 '창발적 능력'에 대한 새로운 설명 프레임워크를 제공한다.
**방법론적 기여**: 인지과학, 컴퓨터 과학, mechanistic interpretability, 인식론 등 여러 분야의 통합적 접근을 통해 학제간 연구의 모델을 제시한다.
**실용적 함의**: AI 시스템이 인간과 효과적으로 상호작용하기 위해서는 ToM 유사 능력이 필수적이다. 본 연구는 이러한 능력의 한계와 가능성을 명확히 함으로써, 보다 안전하고 효과적인 AI 시스템 설계에 기여할 수 있다.
---
## 2. 본론
### 2.1 마음 이론의 개념적 기초와 AI에서의 출현
#### 2.1.1 마음 이론의 고전적 정의와 발달
Premack과 Woodruff(1978)는 "Does the chimpanzee have a theory of mind?"에서 ToM을 정의했다: "개인이 자신과 타인에게 정신 상태를 귀속시킬 때, 그 개인은 마음 이론을 가지고 있다." Dennett(1978)는 ToM의 가장 엄격한 테스트는 **거짓 믿음(false belief)** 이해라고 주장했다.
Wimmer와 Perner(1983)는 최초의 체계적인 거짓 믿음 과제를 도입했다. 핵심 발견은 4세 미만의 아동들은 일관되게 거짓 믿음을 타인에게 귀속시키는 데 실패하며, 자신의 지식을 기반으로 답변한다는 것이다.
Baron-Cohen 등(1985)은 유명한 Sally-Anne Test를 통해 자폐 스펙트럼 장애에서의 ToM 결핍을 입증했다. 전형적으로 발달하는 아동의 85%가 정답을 말한 반면, 자폐 아동은 20%만이 정답을 말했다.
Perner(1991)는 ToM 발달의 핵심이 **표상적 이해(representational understanding)** 라고 주장했다. 약 4세경에 아이들은 마음이 능동적 해석자이며, 정신 상태가 잘못 표상할 수 있는 표상임을 이해하게 된다.
#### 2.1.2 정보 접근과 인식론적 상태
ToM의 중요한 구성 요소는 **정보 접근(information access)** 이 지식 상태를 결정한다는 이해이다. Perner와 Davies(1991)는 어린 아동이 지식을 현실의 직접적 복사본으로 이해한다고 발견했다("copy theory of mind"). 이 발달 과정의 핵심은 **정보 비대칭성(information asymmetry)** 을 인식하고 추론하는 능력이다.
아동은 다음의 원리들을 학습해야 한다:
1. **지각적 접근 원리**: 직접적 지각이 지식을 생성한다
2. **출처 모니터링**: 지식은 특정 정보 출처에서 온다
3. **무지 원리**: 접근의 부재는 지식의 부재를 의미한다
4. **거짓 믿음 원리**: 낙후된 정보는 거짓 믿음을 만든다
5. **관점 원리**: 차별적 정보 접근은 다른 관점을 생성한다
#### 2.1.3 AI 시스템에서 ToM의 실증적 출현
**Kosinski (2024) - PNAS의 획기적 연구**
Kosinski의 2024년 PNAS 논문은 LLM ToM 연구의 이정표이다:
- **모델 범위**: GPT-1, GPT-2, 6개의 GPT-3 변형, ChatGPT-3.5-turbo, ChatGPT-4, Bloom 등 총 11개 LLM
- **과제 설계**: 40개의 맞춤형 거짓 믿음 과제
- **평가 기준**: 16개 프롬프트 중 16개 모두 성공해야 과제 해결로 인정 (가장 엄격)
**정량적 결과**:
- 2020년 이전 모델: 0%에 가까운 성공률
- GPT-3-davinci-001 (2020년 5월): ~40% 정확도 (≈3.5세 아동)
- GPT-3-davinci-002 (2022년 1월): ~70% 정확도 (≈6세 아동)
- **GPT-4 (2023년 6월): 75% 과제 해결 [95% CI: 66-84%]** (≈6세 아동)
Kosinski의 핵심 해석: ToM 유사 능력이 "언어 능력 향상의 부산물로 자발적으로 출현했을 수 있다."
**Strachan et al. (2024) - Nature Human Behaviour**
- **인간 샘플**: N = 1,907명
- **모델**: GPT-4, GPT-3.5, LLaMA2-70B/13B/7B
**정량적 결과**:
- 거짓 믿음: 모든 모델 ~100%, 인간 95%
- 아이러니: GPT-4가 인간보다 우수 (P=0.040, r=0.32)
- 암시: GPT-4가 인간보다 우수 (P=0.040, r=0.32)
- 이상한 이야기: GPT-4가 인간보다 우수 (P=1.04×10⁻⁵, r=0.60)
가장 흥미로운 발견: **실수 가능성 테스트**에서 질문을 확실성에서 가능성으로 재구성했을 때, GPT-4의 정확도가 100%로 상승. 이것은 "초보수주의" 가설을 지지한다.
**고차 ToM과 기만 능력**
Street 등(2024)은 GPT-4가 5차 믿음에서 성인 수준을 달성하고, 6차 문제에서는 인간을 능가한다고 보고했다.
Hagendorff 등(2024)은 PNAS에 기만 능력 연구를 발표:
- GPT-4 단순 기만: 99.16% (P<0.001)
- GPT-4 2차 기만 + CoT: 71.46% (P<0.001)
안전성 우려: 기만 능력은 의도하지 않게 출현했으며, AI 정렬 위험을 제기한다.
#### 2.1.4 새로운 벤치마크
**ToMBench (Chen et al., 2024, ACL)**
- 8개 과제, 31개 능력, 2,860개 테스트 샘플
- 이중언어, 처음부터 구축하여 데이터 오염 방지
- GPT-4조차 인간보다 10% 이상 뒤처짐
**MMToM-QA (Jin et al., 2024, ACL)**
- 최초의 다중모드 ToM 벤치마크
- 현재 LLM/LMM이 강건한 다중모드 ToM을 결여
### 2.2 인과적 마스킹의 아키텍처적 메커니즘
#### 2.2.1 수학적 정식화
Vaswani 등(2017)의 "Attention is All You Need"는 인과적 마스킹을 다음과 같이 설명한다:
> "우리는 디코더 스택의 self-attention 부속층을 수정하여 위치들이 후속 위치들을 참조하는 것을 방지한다."
**Scaled Dot-Product Attention**:
```
Attention(Q, K, V) = softmax(QK^T / √d_k) V
```
**인과적 마스킹 적용**:
```
Attention(Q, K, V) = softmax(Mask(QK^T / √d_k)) V
Mask(S)_ij = { S_ij if j ≤ i
{ -∞ if j > i
```
**행렬 표현** (하삼각 행렬):
```
M = [1 0 0 0 ... 0]
[1 1 0 0 ... 0]
[1 1 1 0 ... 0]
[⋮ ⋮ ⋮ ⋮ ⋱ ⋮]
[1 1 1 1 ... 1]
```
#### 2.2.2 GPT와 BERT: Autoregressive vs. Bidirectional
**GPT 아키텍처**:
- 모든 self-attention 레이어에서 인과적 마스킹 적용
- 단방향 컨텍스트 (왼쪽→오른쪽)
- Autoregressive: P(x₁, x₂, ..., xₙ) = ∏ᵢ P(xᵢ | x₁, ..., xᵢ₋₁)
**BERT 아키텍처**:
- 인과적 마스킹 없음 - 완전한 양방향 self-attention
- Masked Language Model (MLM) 목적 함수 사용
- 모든 위치가 모든 위치에 참조 가능
**실증적 비교** (BERT 논문, Table 5):
- LTR(GPT-like): MNLI 82.1%, SQuAD 77.8 F1
- BERT(bidirectional): MNLI 84.4%, SQuAD 88.5 F1
양방향 컨텍스트가 이해 과제에 중요하지만, **BERT가 ToM 과제에서 어떻게 수행되는지에 대한 직접적인 테스트가 없다**는 것이 중요한 격차이다.
#### 2.2.3 정보 흐름 제약
인과적 마스킹은 방향성 정보 흐름을 만든다:
- 정보는 엄격하게 과거 → 현재로 흐름
- 의존성의 DAG를 만듦
- 토큰 i의 표상은 오직 토큰 {1, ..., i}의 함수
**왜 Autoregressive 생성에 필수적인가**:
훈련-추론 일관성:
1. **훈련 중**: 모든 토큰이 사용 가능하지만, 마스킹은 미래를 보는 것을 방지
2. **추론 중**: 미래 토큰은 아직 존재하지 않음
Autoregressive 모델링:
```
P(x₁, x₂, ..., xₙ) = P(x₁) · P(x₂|x₁) · P(x₃|x₁,x₂) · ...
```
인과적 마스킹은 각 P(xᵢ|x₁,...,xᵢ₋₁)이 적절한 컨텍스트만 사용하도록 보장한다.
### 2.3 정보 접근 제약과 ToM의 관계: 이론적 연결
#### 2.3.1 정보 비대칭성의 핵심성
ToM의 본질은 **정보 비대칭성**을 인식하고 추론하는 것이다. 이 개념은 경제학(Akerlof, Spence, Stiglitz), 인식론, 발달심리학을 가로지른다.
인과적 마스킹은 구조적으로 유사한 비대칭성을 생성한다: 각 토큰 위치는 과거 토큰이 접근한 정보(그들이 '아는' 것)와 미래 토큰이 아직 접근하지 못한 정보(그들이 '모르는' 것) 사이를 구분해야 한다.
#### 2.3.2 Metacognition과 ToM의 발달적 연결
2024년 최근 연구: 52명의 아동을 1.5년간 추적하여 **메타인지적 내성이 ToM 이전에 출현**하고 ToM 발달을 예측한다는 것을 발견했다.
**매개 모델**: 내성 → 억제 통제 → 마음 이론
함의: **자기-지식이 타인-지식에 선행**한다.
Kuhn(2023)은 ToM에서 성인 인식론적 인지까지의 지속적인 발달적 연결을 주장한다. ToM은 단순히 4세에 달성되는 것이 아니라 성인기까지 계속 발달한다.
Birch와 Bloom(2007)의 "지식의 저주": 성인들도 타인의 인식론적 상태에 대해 추론할 때 자신의 지식을 무시하는 데 어려움을 겪는다.
### 2.4 실증적 연구 결과 및 증거
#### 2.4.1 Mechanistic Interpretability: Lookback 메커니즘
Bau Lab의 2024-2025 발견은 LLM이 믿음을 추적하는 방법에 대한 최초의 회로 수준 설명을 제공한다.
**알고리즘 단계** (Llama-3-70B-Instruct):
1. **인코딩 단계**: 모델은 저차원 부공간에 Ordering ID를 캐릭터/객체/상태 토큰에 기록
2. **바인딩 단계**: QK-회로가 주소-포인터 매칭을 수행
3. **답변 단계**: 상태 OI가 새로운 주소-포인터 시스템으로 작동
4. **가시성 확장**: 캐릭터 B가 A를 관찰할 때, 관찰된 캐릭터 정보를 통합
이 메커니즘은 순차적 처리가 "누가 무엇을 봤는가"를 추적하는 포인터/역참조 시스템을 통해 믿음 추적을 가능하게 하는 방법을 보여준다.
#### 2.4.2 Induction Heads
Anthropic(2022)의 발견:
- 레이어 1: "이전 토큰" attention 패턴 계산
- 레이어 2: "현재 토큰이 패턴과 일치" 계산
- ToM 관련성: "컨텍스트 X면, 예측 Y"의 패턴은 조건부 정신 상태 추론을 반영
#### 2.4.3 희소 ToM-민감 파라미터
Wu 등(2025)의 Nature npj AI 논문:
- 극도로 희소 (0.001%) ToM-민감 파라미터 패턴 발견
- Rotary Position Embedding (RoPE)와 밀접하게 연결
- 아키텍처 의존적: 비-RoPE 모델은 동일한 패턴을 보이지 않음
ToM 능력이 모델 전체에 분산되어 있지 않고, 특정 아키텍처 구성 요소에 의존하는 매우 특정한 메커니즘에 집중되어 있음을 시사한다.
### 2.5 반론과 대안 가설
#### 2.5.1 "확률적 앵무새" 비판
Bender 등(2021)의 "On the Dangers of Stochastic Parrots" (FAccT):
LLM을 "확률적 정보에 따라 언어 형식의 시퀀스를 결합하지만, 의미에 대한 참조 없이" 결합하는 시스템으로 특징짓는다.
**ToM 함의**: LLM이 단순히 패턴 매처라면, 명백한 ToM 능력은 개념적 이해보다는 표면적 상관관계이다.
#### 2.5.2 형태 vs. 의미: 접지 문제
Bender와 Koller(2020): "형태만으로 훈련된 시스템은 선험적으로 의미를 학습할 방법이 없다."
**문어 사고 실험**: 수중의 문어가 통계적 패턴을 학습하지만, 언어가 참조하는 세계를 경험한 적이 없어 의미를 이해하지 못한다.
#### 2.5.3 사소한 변경에 대한 실패
Ullman(2023): 작고 논리적으로 무관한 수정이 극적인 성능 하락을 일으킴
- GPT-3.5 성능: ~90%에서 ~6%로 하락
**비판적 결론**: "이 모델들은 아직 마음 이론과 같은 것을 학습하지 않았다"
#### 2.5.4 데이터 오염
Deng 등(2024): MMLU에서 ChatGPT는 52%, GPT-4는 57% 정확 일치율로 누락된 옵션을 추측
Xu 등(2024): BDC가 "부정확하거나 신뢰할 수 없는 성능"을 야기
#### 2.5.5 가짜 상관관계와 지름길
Tu 등(2020): LLM은 가짜 특징을 이용—훈련에서 상관관계가 있지만 인과적으로 결정하지 않는 패턴
#### 2.5.6 양방향 모델: 중요한 격차
BERT와 같은 양방향 모델이 인과적 마스킹 없이 ToM을 개발할 수 있는지는 **크게 탐구되지 않았다**. 이것은 ToM 연구에서 중요한 방법론적 한계를 나타낸다.
### 2.6 학계의 논쟁점
#### 2.6.1 출현 vs. 완화된 향상
**출현 진영** (Wei et al., 2022): 능력이 특정 척도 임계값에서 급격하게 나타남
**회의 진영** (Schaeffer et al., 2023): 출현은 메트릭 선택의 인공물일 수 있음
#### 2.6.2 진정한 ToM vs. "Clever Hans"
**진정한 ToM 진영**: 복잡한 벤치마크에서 인간 수준 성능, 구조화된 내부 표상
**Clever Hans 진영**: 사소한 교란에 극단적 취약성, 얕은 휴리스틱 의존
**중간 입장** (Strachan): 역량과 수행의 해리, 초보수주의
#### 2.6.3 Level-1 vs. Level-2 추론
Chi 등(2025):
- **Level-1**: 임베드된 인과 지식을 사용하는 얕은 추론
- **Level-2**: 반사실적 사고와 개입 모델링을 사용하는 진정한 인과 추론
- LLM은 주로 level-1에서 작동
#### 2.6.4 벤치마크의 타당성
Abdulhai 등(2024): "리터럴 ToM"(행동 예측)과 "기능적 ToM"(적응적 추론)을 구분해야 함
---
## 3. 결론 (Conclusion)
### 3.1 핵심 발견
**1. ToM 유사 능력의 실증적 출현**: GPT-4는 75%의 거짓 믿음 과제를 해결하여 6세 아동 수준에 필적. 2020년경 급격한 출현.
**2. 인과적 마스킹의 구조적 제약**: '의도적 무지'의 아키텍처를 만듦. 엄격한 정보 흐름 비대칭성.
**3. 이론적 연결**: ToM의 핵심은 정보 비대칭성 추적. 인과적 마스킹은 구조적으로 유사한 문제를 만듦. Lookback 메커니즘이 직접적 증거 제공.
**4. 회의적 관점의 타당성**: Ullman의 실패 사례, Bender의 접지 문제, 데이터 오염, 가짜 상관관계가 모두 타당성 가짐.
**5. Level-1 vs. Level-2**: 현재 LLM은 주로 level-1 ToM(패턴 암기)을 보일 수 있음.
### 3.2 인과적 마스킹과 ToM: 관계의 본질
**우리의 결론**: 인과적 마스킹은 ToM에 *충분하지* 않지만 *기여할 수 있다*.
1. **구조적 유사성**: 둘 다 "누가 무엇을 아는가" 문제를 다룸
2. **메커니즘적 지지**: Lookback 메커니즘이 순차적 처리 의존성 보여줌
3. **필요 조건이 아님**: 양방향 모델도 가능할 수 있음 (미검증)
4. **충분하지 않음**: 작은 모델은 ToM을 보이지 않음
**더 정확한 특성화**: 인과적 마스킹은 **ToM 유사 능력 출현을 위한 가능 조건**일 수 있지만, 충분 조건이나 필요 조건은 아니다.
### 3.3 진정한 ToM인가, 시뮬레이션인가?
철학적으로 가장 깊은 질문은 미해결로 남아 있다. 이것은 궁극적으로 **경험적 질문**이다:
1. 내부 메커니즘 연구
2. 일반화 패턴 분석
3. 발달 궤적 추적
4. 신경과학 수렴 탐구
현재 증거는 혼합적이다.
### 3.4 미래 연구 방향
**방법론적 우선순위**:
1. 통제된 아키텍처 비교 (인과적 vs. 양방향)
2. 오염 방지 평가
3. Level-2 ToM 테스트
4. 다중모드 접지
5. 발달 궤적 연구
**이론적 개발**:
1. 계산 이론과 최소 충분 조건
2. 아키텍처 혁신
3. 척도 법칙과 출현 예측
4. 철학적 명확성
**실용적 함의**:
1. AI 안전성 (기만 능력, ToM-민감 파라미터)
2. 인간-AI 협력
3. 편향 완화
4. 설명 가능성
### 3.5 최종 평가
**인과적 마스킹과 마음 이론 간의 관계는 직접적 인과가 아니라 구조적 친화성 중 하나이다.** 인과적 마스킹은 정보 비대칭성의 아키텍처를 만들며, ToM은 그러한 비대칭성을 추론하는 것을 요구한다. 이 친화성은 우연이 아니다—둘 다 근본적으로 "누가 무엇을 아는가" 문제를 다룬다.
그러나 이 친화성은 ToM 출현을 보장하지 않는다. 척도, 데이터 품질, 훈련 방법론, 그리고 아직 이해되지 않은 요인들이 모두 역할을 한다.
**본 연구의 가장 중요한 기여는 이 질문들을 명확하게 하고, 증거를 체계화하며, 미래 연구를 위한 프레임워크를 제공하는 것이다.**
"LLM이 ToM을 가지고 있는가?"라는 이분법적 질문은 부적절하다. 대신:
- *어떤 종류*의 ToM 유사 능력이 있는가?
- *어떤 조건*에서 강건한가?
- *어떤 메커니즘*이 그것을 지원하는가?
- *어떤 한계*를 가지고 있는가?
**의도적 무지의 아키텍처—인과적 마스킹—는 인공 마음 이론으로 가는 경로가 아니라, 그러한 능력이 출현할 수 있는 계산 공간의 한 차원이다.** 이 차원을 이해하는 것은 진정으로 사회적으로 지능적인 AI를 구축하는 더 큰 과제에 한 조각을 기여한다.
---
## 참고문헌 (References) - 주요 선별
### 마음 이론 - 고전
- Premack, D., & Woodruff, G. (1978). Does the chimpanzee have a theory of mind? *Behavioral and Brain Sciences*, 1(4), 515-526.
- Baron-Cohen, S., et al. (1985). Does the autistic child have a "theory of mind"? *Cognition*, 21(1), 37-46.
- Wimmer, H., & Perner, J. (1983). Beliefs about beliefs. *Cognition*, 13(1), 103-128.
- Perner, J. (1991). *Understanding the Representational Mind*. MIT Press.
### AI에서 ToM 출현
- Kosinski, M. (2024). Evaluating large language models in theory of mind tasks. *PNAS*, 121(45), e2405460121.
- Strachan, J.W.A., et al. (2024). Testing theory of mind in LLMs and humans. *Nature Human Behaviour*, 8, 1285–1295.
- Hagendorff, T., et al. (2024). Deception abilities emerged in LLMs. *PNAS*, 121(24), e2317967121.
- Wu, Y., et al. (2025). How LLMs encode theory-of-mind. *npj Artificial Intelligence*, 1, 20.
### 트랜스포머
- Vaswani, A., et al. (2017). Attention is all you need. *NIPS*, 6000-6010.
- Devlin, J., et al. (2019). BERT. *NAACL-HLT*, 4171-4186.
### Mechanistic Interpretability
- Anthropic (2022). In-context Learning and Induction Heads.
- Bau Lab (2024-2025). Lookbacks to Track Beliefs.
### 비판
- Bender, E.M., et al. (2021). Stochastic Parrots. *FAccT*, 610-623.
- Ullman, T. (2023). LLMs Fail on Trivial Alterations. *arXiv:2302.08399*.
- Shapira, N., et al. (2024). Clever Hans or Neural ToM? *EACL*, 2257-2273.
*전체 60+ 피어 리뷰 출처는 본문에 완전한 인용과 함께 제공됨*