Paper Review

이번 주 AI/ML 논문 훑어보기 (26.03.02 ~ 03.08)

AI 에이전트·멀티모달·월드모델

Changjin Han6 min read

요즘 AI 논문을 쭉 보다 보면, 단순히 말을 잘하는 모델에서 끝나지 않고 오래 일하고 믿고 맡길 수 있는 시스템으로 가려는 움직임이 또렷합니다.

이번 주에 특히 눈에 들어온 건 세 갈래였어요. 여러 에이전트가 같이 일할 때 어떻게 망가지는지 정면으로 다루고, 에이전트가 세션이 바뀌어도 기억을 유지하게 만들고, 막연한 AGI 대신 특화 지능과 월드 모델 같은 더 단단한 목표로 재정렬하는 흐름입니다.

🤝 다중 에이전트 합의, 생각보다 더 자주 무너진다

제가 에이전트를 붙여서 자동화 파이프라인을 만들 때 가장 먼저 부딪히는 건, 성능이 아니라 조율이었습니다.

Can AI Agents Agree?는 그 불편한 진실을 아주 건조하게 확인해줘요. 에이전트들이 최종 값에 이해관계가 없는 무투자 환경에서도, 비잔틴 합의 게임에서 합의가 안정적으로 나오지 않았고, 그룹이 커질수록 더 흔들렸습니다.

흥미로운 건 실패가 교묘한 값 조작보다 타임아웃, 수렴 정체 같은 생존성 문제로 많이 발생했다는 점이에요. 제 경험상도 비슷하더라고요. 똑똑한 말은 계속하는데 결론이 안 나거나, 서로 같은 말만 반복하다가 시간만 쓰는 식입니다.

원문은 여기서 확인할 수 있어요: Can AI Agents Agree?

🧠 장기 기억과 지식 인프라: 에이전트의 바퀴 재발명 막기

에이전트를 써보면, 매 세션마다 기억이 리셋되는 느낌을 자주 받습니다.

SkillNet은 이 문제를 기술의 축적이라는 관점에서 풀어요. 20만 개가 넘는 AI 기술을 온톨로지로 묶고, 안전성이나 실행 가능성 같은 기준으로 다차원 평가까지 합니다. 덕분에 에이전트가 예전 전략을 재사용할 수 있고, 실험에서는 평균 보상이 크게 오르고 실행 단계가 줄었습니다.

제가 느낀 인사이트는 이거예요. 앞으로 에이전트 성능 경쟁은 모델 크기보다, 기술을 저장하고 재조합하는 저장소 설계에서 더 많이 갈릴 가능성이 큽니다.

관련 자료는 여기: SkillNet 논문 / SkillNet GitHub

🧩 협업 학습의 새 방식: 서로 다른 에이전트가 같이 강해지려면

다중 에이전트 강화학습을 고민하면, 결국 학습 비용과 배포 조정 비용이 발목을 잡습니다.

HACRL은 이질적인 에이전트들이 추론 단계에서는 독립적으로 움직이되, 학습 중에는 검증된 롤아웃을 공유하면서 양방향으로 배우게 하자는 접근입니다. 여기서 제안한 HACPO는 롤아웃 비용을 절반으로 낮추면서도 평균 성능을 개선했다고 하니, 실무적으로도 귀가 솔깃하죠.

제가 이 흐름에서 얻은 감각은, 앞으로는 같은 모델 여러 개를 늘리는 방식보다, 다른 성격의 모델들이 데이터를 어떻게 주고받으며 같이 성장하느냐가 더 중요해질 수 있다는 점입니다.

원문 링크: HACRL / 프로젝트 페이지

🗂️ 코드베이스에서 에이전트를 굴리려면, 컨텍스트를 문서화해야 한다

현실의 코드베이스는 길고 복잡하고, 무엇보다 관행이 많습니다.

Codified Context는 10만 줄이 넘는 C# 분산 시스템 개발 과정에서, 에이전트가 세션을 넘어 일관성을 유지하도록 만든 인프라를 제안합니다. 관행과 검색 훅을 담은 핫 메모리, 여러 전문 도메인 에이전트, 필요할 때 꺼내보는 콜드 메모리 지식 기반으로 구성되고, 실제 개발 세션 데이터를 통해 전파 효과까지 분석합니다.

제가 느낀 포인트는 명확했어요. 컨텍스트를 프롬프트로만 해결하려는 순간, 팀의 규칙은 계속 새어 나갑니다. 결국 컨텍스트를 운영 가능한 자산으로 만드는 게 답에 가깝습니다.

참고 링크: Codified Context / GitHub

👁️ 멀티모달 사전학습: 언어 vs 비전의 불균형을 인정하는 순간 길이 보인다

Beyond Language Modeling은 멀티모달 사전학습을 처음부터 통제된 방식으로 실험하면서, 설계 공간을 좀 더 투명하게 보여줍니다.

여기서 꽤 중요한 관찰이 나오는데, 비전은 언어보다 훨씬 더 데이터 집약적이라는 스케일링 비대칭성이 확인됩니다. 그리고 MoE 같은 아키텍처가 그 비대칭을 조화시키는 힌트가 될 수 있다고 말하죠.

제가 실무에서 멀티모달을 붙일 때 생기던 비용 폭탄이, 사실은 구조적으로 당연한 현상일 수 있다는 걸 다시 확인한 느낌이었습니다.

원문 링크: Beyond Language Modeling / 프로젝트 페이지

🧪 과학 발견형 AI는 검색 복잡성부터 깨야 한다

MOOSE-Star는 과학적 발견에서 중요한 P(가설|배경)을 직접 학습하려 하면, 방대한 지식 기반에서 조합 폭발이 일어난다는 점을 수학적으로 짚습니다.

그래서 작업을 잘게 쪼개 학습하고, 동기 기반 계층 검색으로 관련 없는 공간을 잘라내고, 구성 범위를 제한해 노이즈에도 버티게 만들면서 복잡도를 지수에서 로그로 낮추려 합니다. 데이터셋 TOMATO-Star도 함께 공개했고요.

제 인사이트는 이거였습니다. 앞으로 지식 작업 에이전트는 모델의 똑똑함보다, 검색 공간을 어떻게 설계하고 가지치기하느냐가 성능의 대부분을 결정할 수 있습니다.

참고 링크: MOOSE-Star / TOMATO-Star 데이터셋 / GitHub

🌍 월드 모델을 말하려면, 일관성부터 체크해야 한다

The Trinity of Consistency는 일반 월드 모델에 필요한 원칙을 세 가지 일관성으로 정리합니다. 모달 일관성, 공간 일관성, 시간 일관성.

제가 이걸 흥미롭게 본 이유는, 월드 모델을 논할 때 자꾸 데모 영상이나 인상비평으로 흐르는데, 이 논문은 최소한 무엇을 맞춰야 월드 모델이라고 부를 수 있는지 체크리스트를 주기 때문이에요. CoW-Bench 같은 벤치마크도 같이 제안해서, 평가의 방향을 잡으려는 의지도 보이고요.

원문 링크: The Trinity of Consistency / CoW-Bench

🧰 터미널 에이전트 성능은 결국 데이터 엔지니어링 싸움이다

Nemotron-Terminal은 터미널 작업을 잘하는 모델 뒤에 무엇이 있었는지, 데이터 생성과 학습 전략으로 설명하려는 쪽입니다.

합성 작업 생성 파이프라인을 만들고, 필터링이나 커리큘럼, 긴 컨텍스트 학습 같은 전략을 분석한 뒤, Terminal-Corpus로 학습해서 작은 모델도 벤치에서 크게 끌어올립니다. 저는 여기서 현실적인 희망을 봤어요. 모든 팀이 초거대 모델을 못 가지더라도, 데이터 설계로 싸울 수 있는 여지가 생각보다 큽니다.

원문 링크: On Data Engineering for Scaling LLM Terminal Capabilities / Nemotron-Terminal 컬렉션

🎯 AGI 대신 SAI: 목표를 바꾸면 로드맵이 선명해진다

AI Must Embrace Specialization은 AGI라는 말이 너무 많은 뜻을 담아서, 오히려 논의를 흐린다고 지적합니다.

대신 초인적 적응 지능 SAI를 이야기해요. 중요한 과업들에서 인간을 넘어서되, 그 방식은 범용 환상이 아니라 전문화와 빠른 적응으로 가야 한다는 주장입니다. 제가 공감한 지점은, 실제 제품은 늘 도메인 문제로 끝장을 보는데, 연구 담론만 자꾸 만능을 꿈꾸는 괴리가 있다는 점이었어요.

원문 링크: AI Must Embrace Specialization via SAI

🧭 시사점: AI는 말 잘하는 도구에서 운영 가능한 시스템으로 이동 중

이번 흐름을 한 문장으로 묶으면, 합의가 흔들리는 다중 에이전트를 더 안정적으로 만들고, 기억과 기술을 축적하는 인프라를 깔고, 멀티모달과 월드 모델은 일관성과 스케일링 원칙으로 재정의하는 방향으로 AI가 이동하고 있다는 느낌입니다.

요약하자면, 에이전트의 협업은 합의 실패와 생존성 문제를 먼저 해결해야 하고, 장기 기억과 기술 온톨로지 같은 인프라가 성능을 좌우하며, 멀티모달과 월드 모델은 데이터 비대칭과 일관성 원칙을 중심으로 더 현실적인 설계 단계로 들어가고 있습니다.

댓글 보기 · Disqus
이 글의 목차🤝 다중 에이전트 합의, 생각보다 더 자주 무너진다🧠 장기 기억과 지식 인프라: 에이전트의 바퀴 재발명 막기🧩 협업 학습의 새 방식: 서로 다른 에이전트가 같이 강해지려면🗂️ 코드베이스에서 에이전트를 굴리려면, 컨텍스트를 문서화해야 한다👁️ 멀티모달 사전학습: 언어 vs 비전의 불균형을 인정하는 순간 길이 보인다🧪 과학 발견형 AI는 검색 복잡성부터 깨야 한다🌍 월드 모델을 말하려면, 일관성부터 체크해야 한다🧰 터미널 에이전트 성능은 결국 데이터 엔지니어링 싸움이다🎯 AGI 대신 SAI: 목표를 바꾸면 로드맵이 선명해진다🧭 시사점: AI는 말 잘하는 도구에서 운영 가능한 시스템으로 이동 중