요즘 새 모델이 나올 때마다 스펙표만 보고 넘기기 쉬운데, 이번 주 논문들을 쭉 보다 보니 느낌이 좀 달랐습니다. 파라미터만 몇 억 더 늘린 수준이 아니라, 모델이 스스로 얼마나 깊이 생각할지, 어떤 모델을 쓸지, 어떤 메모리를 설계할지까지 결정하는 쪽으로 확실히 방향이 옮겨가고 있더라고요. 그래서 이번 글에서는 논문을 하나씩 촘촘히 리뷰하기보다는, 이 논문들이 함께 그리는 큰 그림 위주로 풀어보려고 합니다.
🧠 동적으로 모델을 갈아타는 에이전트, AdaptEvolve
예전엔 이런 생각을 많이 했습니다. 애초에 큰 LLM 한 번 부르는 비용이 너무 크니까, 그냥 작은 모델로 최대한 버티다가 정말 필요할 때만 큰 모델을 부르면 안 될까? 이번 주 논문 중 AdaptEvolve 는 이 질문에 꽤 그럴싸한 답을 줍니다.
핵심은 간단합니다. 진화적 에이전트가 여러 세대에 걸쳐 문제를 개선해 나갈 때, 매 단계마다 "이번 스텝은 작은 모델로도 충분한가, 아니면 큰 모델을 써야 하나"를 모델의 '자신감’으로 판단해서 라우팅합니다. 그리고 이걸 정적인 규칙이 아니라, 생성 과정에서 나오는 내부 신호를 활용해서 동적으로 결정합니다.
실험 결과가 꽤 인상적인데, 평균 추론 비용을 37.9% 줄이면서도, 항상 큰 모델만 썼을 때 성능의 97.5%를 유지했다는 점이 눈에 들어옵니다. 이 정도면 "그냥 큰 모델만 쓰면 되지"라는 말을 하기가 슬슬 민망해지는 숫자죠.
코드는 공개되어 있어서, 개인 프로젝트에서도 금방 따라 해볼 수 있습니다. 구현이 궁금하다면 AdaptEvolve GitHub 저장소 를 한번 직접 들여다보는 걸 추천합니다.
개인적으로는, 앞으로 LLM 애플리케이션 구조를 설계할 때 "파라미터 얼마짜리 모델을 쓸까"보다 "어떤 기준으로 모델을 갈아탈까"를 먼저 고민하게 될 것 같다는 생각이 들었습니다.
🔍 길게 말하는 LLM이 아니라, 깊이 생각하는 LLM – Think Deep
Chain-of-Thought가 유행한 뒤로, 우리도 프롬프트에 “생각을 단계별로 자세히 설명해줘” 같은 말을 습관처럼 붙이게 됐죠. 그런데 실제로 써보면, 길게 떠든다고 해서 꼭 더 똑똑해지는 건 아니라는 걸 다 느끼셨을 겁니다.
Think Deep, Not Just Long 논문은 이 직관을 꽤 날카롭게 파고듭니다. 이들이 정의한 개념이 재미있는데, 바로 '딥 씽킹 토큰’입니다. 모델 내부 레이어를 따라가다 보면 어떤 토큰은 깊은 레이어로 갈수록 예측이 여러 번 크게 수정되고, 어떤 토큰은 거의 변화가 없습니다. 전자를 딥 씽킹 토큰이라고 부르고, 전체 생성 중 이런 토큰이 차지하는 비율을 '딥 씽킹 비율’로 삼습니다.
그리고 이 비율이 실제 정답률과 꽤 잘 맞춰서 움직인다는 걸 수학/과학 벤치마크에서 보여주죠. 단순히 토큰 길이, 로짓 기반 신뢰도보다 더 잘 맞습니다.
이 통찰을 이용해 제안한 전략이 Think@n입니다. 요약하자면 "초반 몇 토큰만 보고, 딥 씽킹 비율이 낮으면 그냥 일찍 버리고, 높은 샘플만 끝까지 생각하게 만든다"에 가깝습니다. 이 방식으로 자기 일관성(self-consistency)에 상응하거나 더 나은 성능을 유지하면서도 추론 비용을 줄입니다.
개발자 입장에서 보면, 이건 "테스트 타임 스케일링"을 재미있게 활용하는 예시입니다. 지금까지는 샘플 개수나 토큰 길이만 늘렸다 줄였다 했다면, 앞으로는 "내부적으로 얼마나 진지하게 고민 중인지"를 보고 조절하는 시대가 열릴 수도 있겠다는 생각이 들었습니다.
논문이 궁금하다면 Think Deep 논문 페이지 를 참고해 보세요.
📚 에이전트가 스스로의 약점을 찾아 채우는 DPE
대형 멀티모달 모델을 실제로 써보면, 생각보다 사소한 구멍이 여기저기 뚫려 있는 걸 자주 보게 됩니다. 그런데 이걸 일일이 사람 손으로 진단하고 데이터를 만들어서 다시 학습시키는 건 너무 비효율적이죠.
From Blind Spots to Gains (DPE) 는 이 과정을 가능한 한 에이전트에게 넘기는 구조를 제안합니다. 순환 구조를 떠올리면 편합니다.
-
현재 모델을 진단해서, 어디서 어떻게 실패하는지 분석
-
여러 에이전트가 웹 검색, 이미지 편집 도구 등을 써가며 그 약점에 특화된 데이터 생성
-
그 데이터로 모델을 다시 강화학습 또는 파인튜닝
-
다시 진단으로 돌아가기
이걸 반복하면서 모델이 조금씩 진화하는 구조죠. 중요한 건 "무작정 더 많은 데이터를 먹이는 게 아니라, 실패를 특정 유형의 약점으로 귀속시키고, 데이터 믹스를 그쪽으로 의도적으로 쏠리게 만든다"는 부분입니다.
코드와 데이터도 모두 공개되어 있어서, 멀티모달 모델 개선 파이프라인에 관심 있다면 DPE GitHub 저장소 를 직접 보는 게 이해에 가장 빠릅니다.
제 느낌으론, 이건 "AutoEval + AutoData + AutoTrain"을 하나의 루프로 묶은 버전 같은 느낌이라, 앞으로 상용 서비스에서도 비슷한 구조가 점점 늘어날 것 같다는 생각이 들었습니다.
🎯 사람마다 다른 취향을 진짜로 따라가는 PAHF
개발하면서 가장 많이 듣는 말 중 하나가 이런 거죠. “이 기능 좋은데, 내 스타일은 아닌 것 같아요.” LLM 에이전트도 마찬가지입니다. 기준 성능이 아무리 좋아도, 개인별로는 답답하게 느껴질 때가 많습니다.
PAHF (Personalized Agents from Human Feedback) 는 이 부분을 꽤 정면으로 파고드는 프레임워크입니다. 구조를 간단히 요약하면, 에이전트가 사용자별 메모리를 들고 다니면서 세 가지 루프를 반복합니다.
-
지시가 애매하면 먼저 물어본다 (사전 명확화)
-
메모리에서 과거 선호를 꺼내와 현재 행동을 구체화한다
-
행동 후에 받은 피드백을 메모리에 반영해서 취향 변화를 따라간다
중요한 포인트는 이게 다 "실시간"이라는 점입니다. 정적 로그를 모아 한 번에 학습하는 게 아니라, 인터랙션 중에 바로 반영하고, 나중에 페르소나가 바뀌어도 따라가게 만드는 구조입니다.
벤치마크도 재미있게 짰는데, 물리적 조작 환경과 온라인 쇼핑 두 가지 도메인에서, "처음 만난 사용자 → 어느 정도 취향 파악 → 중간에 취향이 바뀜 → 다시 적응"을 네 단계로 나눠 측정합니다. 결과적으로, 메모리 없는 방식이나, 피드백 채널이 하나뿐인 기준선보다 훨씬 빠르고 정확하게 적응합니다.
실제 구현이 궁금하다면 PAHF 공식 페이지 와 PAHF GitHub 저장소 를 같이 보는 걸 추천합니다.
저는 앞으로 에이전트를 설계할 때 "프롬프트 잘 짜기"만 신경 쓰기보다, "이 에이전트는 사용자에 대해 무엇을 기억하고, 어떻게 잊을 것인가"를 같이 설계해야겠다는 생각이 많이 들었습니다.
🧬 LLM이 스스로 알고리즘을 설계하는 AlphaEvolve
다중 에이전트 강화학습(MARL) 쪽은 솔직히 말하면 알고리즘 설계 난이도가 꽤 높은 영역입니다. CFR, PSRO 같은 이름만 들어도 머리가 지끈거리는 분도 많을 겁니다. 그런데 AlphaEvolve 논문은 이 영역에 꽤 도발적인 질문을 던집니다. “이 복잡한 알고리즘 튜닝을 LLM에게 시키면 어떨까?”
AlphaEvolve는 말 그대로 코드를 진화시키는 LLM 에이전트입니다. 사람 대신 알고리즘 설계 공간을 탐색하면서, 더 나은 변형을 만들어내죠. 이 과정에서 실제로 새로운 알고리즘 두 개를 건져 올립니다.
-
VAD-CFR: 변동성에 따라 할인율을 조절하고, 일종의 낙관주의와 강한 초기 정책 축적 규칙을 결합한 CFR 계열 알고리즘
-
SHOR-PSRO: 낙관적 후회 매칭과 부드러운 최적 전략 분포를 섞어서, 훈련 동안 "다양성 확보 → 균형점 찾기"로 자연스럽게 넘어가게 만드는 PSRO 계열 알고리즘
둘 다 기존 SOTA를 넘는 성능을 보였다는 점이 중요합니다. "LLM이 짜 준 코드는 인간이 짠 것보다 항상 약하다"는 편견을 슬슬 내려놓아야 할 시점이 오는 느낌입니다.
개인적으로 이 논문이 흥미로웠던 이유는, 이제 LLM을 "코드 자동 완성기"가 아니라 "알고리즘 탐색 에이전트"로 쓰는 사례가 점점 실체를 갖추고 있다는 점입니다. 논문은 AlphaEvolve 논문 페이지 에서 확인할 수 있습니다.
🧮 수학 연구까지 들어간 Aletheia
수학 연구 이야기는 약간 먼 세계 같지만, LLM/에이전트의 미래를 상상할 때 빼놓기 어려운 구간이라 이 논문도 짧게 짚고 넘어가고 싶었습니다. Aletheia 는 올림피아드 금메달 수준을 넘어서, 실제 연구 논문을 쓰는 수학 연구 에이전트를 목표로 합니다.
기본은 Gemini Deep Think 계열 모델을 기반으로 하고, 추론 시간을 상당히 확장하면서, 관련 문헌 검색과 증명 수정을 자동으로 수행합니다. 여기서 재밌는 포인트는, 실제로 AI가 주도해 작성한 논문, 인간과 협업해서 완성한 논문, 그리고 700개 이상의 열린 문제를 반자율적으로 풀어본 결과까지 모두 구체적으로 제시한다는 점입니다.
연구의 전체 리소스는 Aletheia GitHub 리포지터리 에 공개되어 있습니다.
개발자 시점에서 이 논문이 주는 인사이트는, “에이전트 + 도구 + 긴 추론” 조합으로 갈 수 있는 최대 난이도 문제의 상한선이 생각보다 많이 올라가 있다는 점입니다. 우리 일상의 문제로 내려오면, 꽤 복잡한 도메인에서도 LLM 에이전트가 장기적인 프로젝트를 어느 정도 책임질 수 있는 시대가 멀지 않았다는 신호처럼 느껴졌습니다.
🧩 메모리 자체를 메타 학습하는 ALMA
마지막으로, 개인적으로 가장 실용적으로 와닿았던 논문이 ALMA 입니다. 요즘 에이전트 프레임워크를 보면, 다들 메모리 모듈을 끼워 넣고는 있는데, 실제 구조는 거의 사람이 감으로 짠 경우가 많습니다. 어떤 스키마를 쓸지, 어떻게 검색할지, 언제 업데이트할지 등등이요.
ALMA는 이걸 아예 메타 학습 대상으로 올려버립니다. 메타 에이전트가 “메모리 설계 코드” 자체를 탐색하면서, 주어진 연속 의사결정 환경들에서 가장 잘 학습하는 구조를 찾아내도록 훈련합니다. 여기에는 데이터베이스 스키마부터, 인덱싱과 조회, 업데이트 로직까지 모두 포함됩니다.
네 가지 도메인 실험에서, 이렇게 학습된 메모리 설계가 기존에 사람이 설계한 메모리보다 일관되게 더 좋은 성능을 냈습니다. 이게 의미하는 바는 꽤 큽니다. "좋은 메모리 구조를 손으로 설계하는 시대에서, 메모리 검색기를 학습시키는 시대"로 서서히 넘어가는 느낌이니까요.
자세한 내용은 ALMA 프로젝트 페이지 와 ALMA GitHub 저장소 를 함께 보시면 흐름을 훨씬 잘 잡을 수 있습니다.
개발자로서 느낀 점은, 앞으로 에이전트 시스템을 설계할 때 아키텍처 고정값으로 두던 요소들조차 "학습 가능한 것"으로 보는 관점이 점점 더 중요해질 거라는 겁니다.
🛰️ 도시, 프라이버시, 그리고 사회적 맥락 – 기타 인상적이었던 논문들
위에 자세히 풀진 않았지만, 이번 주 논문들 중엔 사회적/윤리적 함의를 던지는 연구들도 눈에 띄었습니다.
-
Large-scale online deanonymization with LLMs 은 LLM이 인터넷 텍스트만 가지고도 해커뉴스–링크드인, 서로 다른 Reddit 계정 등을 꽤 높은 정확도로 연결해버릴 수 있다는 걸 보여줍니다. "가명이라서 안전하다"는 가정이 더 이상 유효하지 않을 수 있다는 점에서, 프라이버시 모델을 다시 짜야 할 시점이 오고 있음을 보여주는 연구였습니다.
-
SocioReasoner 는 위성 사진 + 디지털 지도 + 비전-언어 모델을 이용해 도시의 사회적 의미 객체(학교, 공원 등)를 분할하는 방법을 제안합니다. 데이터셋과 코드는 SocioReasoner GitHub 저장소 에 공개되어 있고, 제로샷 성능도 꽤 준수합니다.
이 두 가지를 같이 놓고 보면, LLM이 점점 "현실 세계의 사회적 맥락"을 이해하고 추론하는 쪽으로도 빠르게 확장되고 있다는 걸 체감하게 됩니다.
🧭 마무리: 우리가 지금 어디쯤 와 있는가
이번 주 논문들을 한 번에 묶어보면, 제 눈에는 세 가지 축이 선명하게 보였습니다.
첫째, 효율적인 동적 연산. AdaptEvolve, Think Deep, HyTRec 같은 연구는 "얼마나 큰 모델을 쓰느냐"보다 "언제, 어디에 연산을 쏟을 것이냐"가 더 중요해지는 시대를 보여줍니다.
둘째, 자가 진화와 알고리즘 발견. DPE, AlphaEvolve, Aletheia는 모델이 스스로 약점을 진단하고, 데이터를 만들고, 심지어 알고리즘과 수학적 아이디어까지 제안하는 쪽으로 나아가고 있음을 보여줍니다.
셋째, 지속적이고 개인화된 학습. PAHF와 ALMA는 에이전트의 메모리와 개인화 전략을 "한 번 짜고 끝내는 설계"가 아니라, "상호작용 속에서 계속 바뀌고 학습되는 것"으로 바라보게 합니다.
개발자인 입장에서 저는 이제 "모델을 하나 잘 고르고, 프롬프트를 잘 짜서, API를 잘 감싸자"에서 한 걸음 더 나가야 할 것 같다는 생각을 했습니다. 앞으로 중요한 건,
-
어떤 기준으로 모델과 연산량을 동적으로 조절할지,
-
에이전트가 스스로 부족한 부분을 진단하고 개선하는 루프를 어떻게 설계할지,
-
사용자와 환경에 맞춰 메모리와 행동 전략을 어떻게 계속 바꿔 나갈지,
이 세 가지를 실제 시스템 안에 얼마나 자연스럽게 녹여 넣느냐일 것 같습니다.
이번 글에서는 최근 AI/ML 논문들을 통해, LLM과 에이전트가 단순한 "정적 모델"을 넘어, 연산을 동적으로 조절하고(AdaptEvolve, Think Deep), 스스로 약점을 진단·개선하며(DPE, AlphaEvolve, Aletheia), 사용자와 환경에 맞게 지속적으로 학습하는(PAHF, ALMA) 방향으로 진화하고 있다는 흐름을 살펴봤습니다. 여기에 프라이버시와 도시 이해 같은 현실 세계 문제를 건드리는 연구들까지 더해지면서, 앞으로 우리가 설계해야 할 AI 시스템은 점점 더 "살아 움직이는 존재"에 가까워지고 있습니다.

댓글 보기 · Disqus