
이봐 요, AI 열광적인 팬 여러분! 저는 AIMOJO를 만든 Ali입니다. 챗봇이 겨우 두 문장밖에 이어지지 못하던 시절부터 인공지능에 푹 빠져 있었죠.
그때는, AI 뭔가 거대한 것을 대략적으로 그려낸 것 같았는데, 지금은? ChatGPT, Grok, 그리고 대규모 언어 모델(LLM) 분야의 최신 혁신을 떠올려 보면 매일 감탄이 절로 나옵니다.
그러면 중요한 질문 하나를 살펴보겠습니다. LLM이 실제로 복잡하고 어려운 과제를 얼마나 잘 해결할 수 있을까요?
"어수선한" 문제를 정의하는 것은 무엇인가?
지저분한 문제는 "5 곱하기 7은 뭐지?"라는 간단한 두뇌 자극제가 아닙니다. 마치 눈가리개를 한 채 퍼즐을 조립하는 것 같은 느낌의 문제입니다. 모든 곳에 조각이 있고 명확한 시작점이 없습니다. 이러한 질문은 여러 곳에서 정보를 끌어와 모든 것을 연결하기 위해 논리적 도약을 요구합니다.

- 1단계: "Power"가 King Crimson의 "21st Century Schizoid Man"을 샘플링했다는 것을 인식하세요.
- 2 단계 : 킹 크림슨의 밴드리더가 로버트 프리프라는 것을 알아보세요.
- 3단계: 프리프의 출생년도는 1946년입니다.
그건 여러 단계를 거치는 문제예요. 단순히 하나의 사실을 떠올리는 게 아니라, 여러 사실을 연결해서 풀어야 하죠. 단순한 암기가 아니라 추론 능력이 요구되는 문제라서, 법학 석사(LLM)에게 딱 맞는 유형이에요.
왜 까다로운가
지저분한 문제는 음악, 역사, 대중 문화 등 도메인을 가로질러 점을 연결하는 데 의존하기 때문에 모델을 넘어뜨립니다. 링크 하나만 놓치면 답 전체가 무너집니다.
FRAMES 데이터 세트: LLM을 위한 스트레스 테스트
연구진은 논리 학습 모델(LLM)이 다양한 압력 상황에서 어떻게 작동하는지 알아보기 위해 FRAMES 데이터셋을 구축했습니다. 2024년 논문에 발표된 이 데이터셋은 추론, 수학, 논리, 시간 기반 추론 등 다양한 영역을 아우르는 824개의 다단계 문제 들로 구성되어 있습니다 . 예를 들어 과거 단서를 통해 누군가의 나이를 계산하는 문제 등이 있습니다.

숫자
최고 수준의 법학 석사들이 도움 없이 FRAMES 문제를 풀었을 때, 약 40%의 정확도를 기록했습니다 . 나쁘지는 않지만, 눈부시게 훌륭한 수치는 아닙니다.
그런 다음 연구원들은 검색 증강 생성 (RAG) 을 통해 외부 정보에 접근할 수 있도록 하여 이들에게 구원의 손길을 내밀었습니다 . 그 결과, 설정에 따라 정확도가 66~73%까지 급증했습니다 . 이는 상당한 도약이며, 적절한 지원이 주어졌을 때 LLM이 훨씬 더 빛을 발한다는 것을 보여줍니다.
깊게 파고
FRAMES 논문은 일부 질문에는 최대 35단계의 추론 단계가 필요하다고 언급합니다. 예를 들어, "역사적 인물이 1945년 사건 당시 3세였고, 그 형제가 1980년 후에 태어났다면, 그 형제는 XNUMX년에 몇 살이었을까요?" 이는 수학, 타임라인 추적, 추론을 하나로 합친 것입니다. 어려운 문제입니다!
검색 증강 생성(RAG): Boost의 기반 기술

RAG는 마치 LLM 과정 학생에게 빠른 연구 조교를 붙여주는 것과 같습니다 . 과정은 다음과 같습니다.
왜 도움이 되는가
LLM은 모든 사실을 훈련 데이터에 저장하지 않습니다. RAG는 이러한 격차를 메웁니다. FRAMES에서 40% 기준선이 66-73%로 치솟는 것은 멀티홉 추론에 있어 게임 체인저임을 증명합니다.
캐치
완벽하지는 않습니다. 검색에서 관련성이 없거나 노이즈가 있는 데이터를 끌어오더라도 LLM은 여전히 그것을 망칠 수 있습니다. YouTube 동영상에서는 모델이 모호한 문서를 잘못 해석하여 어떤 경우에는 정확도가 15% 떨어지는 모습이 나왔습니다.
LLM이 어려움을 겪는 곳

패턴 매칭 vs. 진정한 논리 - 증거
2024 년 MIT CSAIL 연구에 따르면 대규모 언어 모델(LLM)은 익숙한 작업에서는 탁월한 성능을 보이지만, 새로운 시나리오에서는 심각한 어려움을 겪으며 진정한 추론보다는 암기에 더 많이 의존하는 것으로 나타났습니다. 이 연구는 체스 포지션 변경이나 10진법이 아닌 다른 진법을 사용한 산술 연산과 같은 가상 시나리오를 통해 모델을 테스트했으며 , 그 결과 정확도가 급격히 떨어졌습니다.
미래를 주도하는 커뮤니티 혁신 AI 추리
LLM이 지저분하고 현실적인 문제를 해결하도록 하는 노력은 대기업만을 위한 것이 아닙니다. 글로벌하고 대중적인 노력입니다. 초기 인터넷 분위기를 생각해 보세요. 혼란스럽고, 엉성하고, 대담한 아이디어로 가득 차 있습니다. 오픈소스 프로젝트와 분산 작업이 방향을 잡고 있습니다. AI 추리 이 흥미로운 공간으로.

오픈소스 강자들
커뮤니티는 대기업과 경쟁할 수 있는 도구를 쏟아내고 있습니다. 포옹하는 얼굴: 그들의 플랫폼은 다음을 호스팅합니다. 100,000년 모델, 그 중 많은 것이 날카롭게 만들어졌습니다. 추론 과제—여러 단계에 걸쳐 단서를 조각조각 모으는 것과 같습니다. 그들의 트랜스포머 도서관은? 사실상 스위스 군용 칼과 같습니다. AI 지금 조사해보세요.
그리고 EleutherAI 라는 반항적인 팀이 만든 GPT-J 가 있습니다 . GPT-J 는 FRAMES 같은 벤치마크에서 GPT-3와 어깨를 나란히 하는 오픈소스 알고리즘입니다. 이는 단순히 멋진 것을 넘어, 괜찮은 사양의 컴퓨터만 있다면 누구나 LLM이 복잡한 퍼즐을 더 잘 풀도록 도울 수 있다는 것을 증명하는 사례입니다.
분산된 승리
다양성은 혁신을 촉진합니다. 앨런 인공지능 연구소는 LLM(법학 석사)들이 단계별로 추론하도록 하는 까다로운 과학 문제 데이터 세트인 ARC( AI2 Reasoning Challenge ) 를 발표했습니다 . 한편, Kaggle 대회는 전 세계 인재들을 모아 복잡한 문제를 해결하고, 연구실에서 놓칠 수 있는 아이디어들을 쏟아내고 있습니다.
솔로 플레이어도 빛납니다. 2024년 arXiv 논문은 긴 맥락 추론을 15%나 강화한 새로운 주의력 조정을 공개했습니다. 이는 LLM이 얽힌 현실 세계의 문제에 필요한 종류의 우위입니다.
지저분한 문제에 연결하기
지저분한 일(예: 뒤죽박죽된 힌트 더미에서 사실을 파헤치는 일)에는 유연하게 생각하고 점을 연결할 수 있는 LLM이 필요합니다. 커뮤니티 활동은 다음을 통해 이를 실현하고 있습니다.
이는 단순한 과대광고가 아닙니다. 이는 LLM을 현실 세계에서 숙달하도록 이끄는 엔진입니다.
추천 자료 :
최종 생각
LLM은 정말 놀랍지만, 복잡한 문제들은 그 한계를 드러냅니다. RAG는 그들에게 큰 활력을 불어넣고, Sentient Chat과 같은 새로운 얼굴들은 앞으로 다가올 일들을 암시합니다. AI 괴짜야, 난 그것이 어떻게 전개되는지 보는 것을 고대하고 있어.
LLM에 던진 지저분한 질문이 있나요? 댓글을 남겨주세요. 여러분의 의견을 듣고 싶습니다.
고수 아이모조 자세한 AI 모험 - 우리는 이제 막 시작일 뿐이야


