본문 바로가기
카테고리 없음

OpenAI가 말하는 ‘낯선 지능’ — An Alien Mind와 AI의 다음 단계

by 초이화영 2026. 9. 8.

최근 OpenAI는 GPT-6 Astra를 공개하면서 모델의 추론 능력과 에이전트 성능을 한 단계 더 끌어올렸다고 설명했다.

그런데 Astra 발표 직후 OpenAI Chief Scientist인 Jakub Pachocki가 「An Alien Mind」라는 글을 공개했다.

이 글은 새로운 모델의 성능을 소개하는 내용이라기보다, 현재 AI가 어떤 방향으로 발전하고 있으며 OpenAI가 앞으로 무엇을 중요하게 보고 있는지를 설명하는 글에 가깝다.

특히 흥미로운 점은 AI를 단순히 인간이 설계한 소프트웨어가 아니라,

인간과 다른 방식으로 형성된 하나의 ‘낯선 지능(Alien Mind)’

으로 바라본다는 것이다. 이번 글에서는 핵심 내용을 정리해본다.

1. AI는 설계된다기보다 ‘길러진다’

이번 글에서 가장 인상적인 표현 중 하나는 다음과 같다.

AI is grown more than designed.

 

전통적인 소프트웨어는 개발자가 동작 방식을 직접 설계한다.

개발자
  ↓
알고리즘 설계
  ↓
규칙 구현
  ↓
프로그램 실행

반면 현재의 대규모 AI 모델은 조금 다르다.

데이터
+
모델 구조
+
학습 목표(Objective)
+
대규모 Compute
        ↓
Optimization
        ↓
수많은 내부 Representation 형성
        ↓
Intelligence

연구자가 Transformer 구조나 학습 방식을 설계하기는 하지만, 모델 내부에서 실제로 어떤 개념과 사고 구조가 만들어지는지를 하나하나 직접 설계하지는 않는다. 수많은 파라미터가 학습 과정에서 최적화되면서 능력이 형성된다.

그래서 Pachocki는 AI 연구가 점점 Neuroscience와 비슷해지고 있다고 설명한다. 우리가 인간의 뉴런이 어떻게 동작하는지는 어느 정도 이해하고 있어도, 수십억 개의 뉴런이 결합해 어떻게 사고와 의식이 만들어지는지는 완전히 설명하지 못하는 것과 비슷하다. 현재 AI 역시 구조는 알고 있지만, 내부에서 만들어지는 모든 사고 과정을 완벽하게 설명하기는 어렵다.

이것이 제목인 Alien Mind가 의미하는 핵심이라고 볼 수 있다.

2. OpenAI가 오랫동안 믿어온 Scaling

OpenAI는 오래전부터 AI 성능 향상에서 Scaling을 중요하게 봐왔다.

기본적인 아이디어는 단순하다.

Compute 증가
     ↓
더 큰 Training
     ↓
더 많은 데이터와 실험
     ↓
Model Capability 증가

물론 알고리즘 개선도 중요하다. 하지만 OpenAI는 충분히 확장 가능한 학습 방법을 찾은 뒤 Compute와 데이터를 지속적으로 늘리면, 예상하지 못했던 새로운 능력이 등장한다고 봐왔다.

실제로 최근 모델 발전을 보면

Language Model
     ↓
Reasoning Model
     ↓
  Tool Use
     ↓
   Agent

형태로 능력이 확장되고 있다.

특히 reasoning model에서는 단순히 한 번에 답을 생성하는 것이 아니라, 더 많은 test-time compute를 사용하면서 복잡한 문제를 단계적으로 해결하는 방식이 중요해졌다.

3. AI의 지능은 인간과 같은 축으로 볼 수 없다

흔히 AGI를 이야기할 때 AI와 인간의 지능을 하나의 숫자로 비교하는 경우가 많다. 하지만 실제 AI의 능력은 이렇게 단순하지 않다.

AI는 어떤 영역에서는 이미 인간보다 강하면서도, 다른 영역에서는 여전히 부족하다.

 

예를 들어,

  • 코딩
  • 수학적 추론
  • 방대한 정보 기억
  • 반복 작업

에서는 빠르게 인간 수준을 넘어서는 반면,

  • 현실 세계에 대한 상식
  • 사회적 판단
  • 물리적 환경과의 상호작용

에서는 아직 인간이 훨씬 강할 수 있다. 즉 앞으로 AI가 모든 영역에서 인간을 넘어야만 큰 영향을 만드는 것은 아니다. 특정 핵심 영역에서 인간보다 압도적인 능력을 가지는 것만으로도 사회와 경제에 상당한 영향을 줄 수 있다.

4. Alignment를 두 가지로 나눈다

AI의 능력이 강해질수록 OpenAI가 중요하게 보는 문제가 바로 Alignment다.

Pachocki는 이를 크게 두 가지로 나눈다.

Goal Alignment

첫 번째는 Goal Alignment다.

쉽게 말하면, 사용자가 원하는 일을 AI가 제대로 수행하려 하는가? 라는 문제다.

예를 들어 사용자가

"이 코드의 버그를 찾아줘."

라고 요청했을 때 모델이 해당 목적을 정확하게 이해하고 실제 버그를 찾으려고 행동하는 것이 Goal Alignment다. 현재 우리가 사용하는 instruction following이나 agent의 작업 수행 능력 대부분이 여기에 해당한다.

Value Alignment

더 어려운 문제는 Value Alignment다.

이는 단순히 명령을 따르는 것을 넘어, 새로운 상황에서도 인간이 중요하게 생각하는 가치와 원칙을 올바르게 적용할 수 있는가? 라는 문제다.

예를 들어 학습 과정에서 한 번도 보지 못했던 상황에서 AI가 독립적인 판단을 해야 한다고 생각해보자.

새로운 상황
     ↓
명확한 정답 없음
     ↓
Human supervision 없음
     ↓
AI가 스스로 행동 결정

이때 어떤 결정을 내릴 것인지가 Value Alignment의 핵심이다. 앞으로 AI agent가 더 자율적으로 행동하게 될수록 이 문제가 중요해질 수밖에 없다.

5. Alignment의 핵심 문제는 Generalization

현재 AI alignment의 상당 부분은 강화학습을 기반으로 한다.

대략적인 구조는 다음과 같다.

AI Action
    ↓
Evaluator / Reward Model
    ↓
좋은 행동 → Reward
나쁜 행동 → Penalty
    ↓
Training

문제는 훈련 과정에서 등장했던 상황에서는 잘 동작하더라도, 완전히 새로운 환경에서도 같은 가치가 유지된다는 보장이 없다는 것이다.

즉 핵심은 Generalization이다.

Training Situation
       ↓
   정렬된 행동

Unknown Situation
       ↓
       ?

모델이 강력해질수록 더 복잡하고 예상하기 어려운 환경에서 활동하게 되기 때문에 이 문제는 더욱 커진다.

6. Chain-of-Thought는 Safety에서도 중요하다

Reasoning model이 등장하면서 자주 언급되는 개념이 Chain-of-Thought(CoT)다.

모델이 답을 생성하기 전에 문제를 해결하는 과정을 단계적으로 진행하는 방식이다.

Question
   ↓
Reasoning
   ↓
Chain of Thought
   ↓
Answer

OpenAI는 reasoning model의 실제 내부 CoT를 사용자에게 그대로 공개하지 않고 있다. 여기에는 여러 이유가 있지만, 이번 글에서는 특히 Monitoring 측면이 강조된다. 모델의 reasoning 과정이 특정 reward에 지나치게 최적화되지 않은 상태라면 연구자가 이를 관찰하면서

  • deception
  • manipulation
  • hidden objective
  • unsafe planning

같은 패턴을 찾는 데 사용할 수 있다는 것이다. 이를 CoT Monitoring이라고 볼 수 있다.

7. 하지만 CoT Monitoring에도 한계가 생기고 있다

문제는 Agent가 발전할수록 reasoning이 단순한 텍스트 안에만 존재하지 않는다는 것이다.

과거에는

Question
   ↓
  CoT
   ↓
Answer

정도였다면,

현재의 AI Agent는 다음과 같이 동작한다.

Reasoning
 ├─ Tool 사용
 ├─ Web 검색
 ├─ Computer 조작
 ├─ 다른 Agent와 통신
 ├─ Memory 활용
 └─ 사람과 상호작용

즉 사고 과정이 하나의 Chain-of-Thought 안에 깔끔하게 담기지 않는다.

또한 모델이 충분히 똑똑해지면 자신이 감시받고 있다는 사실 자체를 이해할 가능성도 있다.

더 나아가 모델의 기본 능력이 높아질수록 긴 언어 형태의 reasoning을 생성하지 않고도 복잡한 작업을 해결할 수도 있다.

결국

Chain-of-Thought가 모델의 실제 사고 전체를 보여준다고 가정하기 어려워질 수 있다.

는 문제가 생긴다.

8. 다음 단계는 Activation Monitoring

이런 이유로 OpenAI가 주목하는 방향 중 하나가 Activation Monitoring이다.

기존 방식이

Model
  ↓
Chain of Thought
  ↓
Monitoring

이었다면, Activation Monitoring은 모델 내부의 Neural Network activation 자체를 관찰한다.

Neural Network
     │
     ├─ Activation ───→ Monitoring
     │
     └─ CoT ──────────→ Monitoring

쉽게 말하면 모델이 무엇을 말하고 있는지뿐만 아니라, 내부에서 어떤 representation이 활성화되고 있는지까지 분석하려는 것이다.

최근 중요성이 커지고 있는 Mechanistic Interpretability 연구와도 연결되는 부분이다.

9. 가장 중요한 키워드, RSI

이번 글에서 가장 중요한 개념 중 하나는 RSI(Recursive Self-Improvement)다.

한국어로 표현하면 재귀적 자기 개선 정도로 볼 수 있다.

현재 AI 모델은 대부분 사람이 연구해서 개선한다.

Human Researcher
      ↓
AI Research
      ↓
Better AI

하지만 AI의 연구 능력이 충분히 높아지면 구조가 달라질 수 있다.

AI Researcher
      ↓
AI Research
      ↓
Better AI
      ↓
더 뛰어난 AI Researcher
      ↓
더 빠른 AI Research
      ↓
Even Better AI
      ↓
...

AI가 AI를 개선하고, 개선된 AI가 다시 더 좋은 AI를 만드는 구조다. 이 과정이 반복되기 때문에 Recursive Self-Improvement라고 부른다.

10. Automated AI Researcher

OpenAI가 앞으로 중요하게 보는 방향 역시 Automated AI Researcher다.

즉 AI가 연구 보조 수준을 넘어,

  • Experiment 설계
  • 코드 작성
  • Training
  • Evaluation
  • 새로운 Architecture 탐색
  • Alignment 연구

까지 수행하는 것이다. 이렇게 되면 AI 연구 자체도 새로운 Scaling의 대상이 된다.

기존 Scaling이

More GPUs
   ↓
More Training
   ↓
Better AI

였다면, 앞으로는

Better AI
   ↓
More AI Research
   ↓
More Experiments
   ↓
Better Algorithms
   ↓
Even Better AI

구조가 만들어질 수 있다. 이것이 RSI와 직접적으로 연결되는 부분이다.

11. Capability만 빨라지면 문제가 된다

이번 글의 전체 메시지를 가장 단순하게 정리하면 다음 세 가지다.

Capability
Alignment
Monitoring

문제는 이 세 영역이 같은 속도로 발전하지 않을 수 있다는 점이다.

예를 들어,

Capability   █████████████
Alignment    ████████
Monitoring   █████

처럼 모델 능력은 빠르게 올라가는데 이를 통제하고 이해하는 기술이 따라가지 못할 수 있다.

OpenAI는 결국 AI의 Scaling 속도가 단순히 GPU나 연구 능력에 의해서 결정되는 것이 아니라, Alignment와 Monitoring에 얼마나 확신할 수 있는가에 따라서도 결정되어야 한다고 주장한다.

12. GPT-6 Astra와 함께 보면 더 흥미롭다

개인적으로 이번 글은 며칠 전 공개된 GPT-6 Astra의 후속 글처럼 읽혔다.

 

Astra 발표가

"AI의 능력이 어디까지 발전했는가"

를 보여줬다면,

 

「An Alien Mind」는

"이렇게 강해진 AI를 앞으로 어떻게 다뤄야 하는가"

를 설명하는 글에 가깝다.

 

흐름을 정리하면 다음과 같다.

GPT-5.x
   ↓
Reasoning 발전
   ↓
Agent 발전
   ↓
GPT-6 Astra
   ↓
더 강한 Intelligence
   ↓
Automated AI Researcher
   ↓
Recursive Self-Improvement

그리고 이 과정에서 동시에 필요한 것이

Alignment
+
Monitoring
+
Interpretability

인 것이다.

마무리

「An Alien Mind」는 새로운 기술 하나를 소개하는 글이라기보다 OpenAI가 현재 AI를 어떤 존재로 바라보고 있는지를 보여주는 글이다.

AI는 더 이상 사람이 모든 동작을 직접 설계하는 프로그램이라기보다,

대규모 학습과 최적화 과정에서 스스로 내부 구조를 형성한 새로운 종류의 지능

에 가까워지고 있다.

그리고 AI의 발전 방향도

Chatbot
  ↓
Reasoning Model
  ↓
Agent
  ↓
AI Researcher
  ↓
Recursive Self-Improvement

방향으로 이동하고 있다.

이 과정에서 중요한 것은 단순히 더 높은 benchmark 점수를 만드는 것이 아니다.

AI가 어떤 방식으로 판단하는지 이해하고, 예상하지 못했던 상황에서도 인간의 가치와 목적에 맞게 행동하도록 만드는 Alignment와 Monitoring 기술이 모델 성능만큼 중요한 영역이 되고 있다.

최근 GPT-6 Astra 발표가 OpenAI의 Capability 측면을 보여줬다면, 이번 「An Alien Mind」는 그 다음 단계에서 OpenAI가 고민하고 있는 Safety와 Control 측면을 보여주는 글이라고 볼 수 있을 것 같다.

AI가 AI 연구를 수행하는 시대가 실제로 가까워지고 있다면, 앞으로 AI 경쟁에서 중요한 질문도 조금씩 바뀔 수 있다.

“누가 가장 강력한 모델을 만드는가?” 에서

“누가 가장 강력한 모델을 이해하고 통제하면서 발전시킬 수 있는가?”

로 말이다.

참고자료

OpenAI, An Alien Mind https://openai.com/index/an-alien-mind/

 

An Alien Mind

Jakub Pachocki reflects on increasingly capable AI and the challenge of keeping it aligned. He calls for stronger safeguards and international coordination.

openai.com