대규모 언어 모델이 복잡하고 어려운 문제를 해결할 수 있을까?

대규모 언어 모델 및 지저분한 추론 과제

이봐 요, AI 열광적인 팬 여러분! 저는 AIMOJO를 만든 Ali입니다. 챗봇이 겨우 두 문장밖에 이어지지 못하던 시절부터 인공지능에 푹 빠져 있었죠.

그때는, AI 뭔가 거대한 것을 대략적으로 그려낸 것 같았는데, 지금은? ChatGPT, Grok, 그리고 대규모 언어 모델(LLM) 분야의 최신 혁신을 떠올려 보면 매일 감탄이 절로 나옵니다.

AIMOJO를 실행하면 제가 가진 열정을 쫓을 수 있습니다. 즉, 이 기술이 실제로 무엇을 할 수 있는지 알아내는 것입니다. 특히 치트시트로는 해결할 수 없는 복잡하고 현실적인 문제에 직면했을 때 더욱 그렇습니다.

그러면 중요한 질문 하나를 살펴보겠습니다. LLM이 실제로 복잡하고 어려운 과제를 얼마나 잘 해결할 수 있을까요?

"어수선한" 문제를 정의하는 것은 무엇인가?

지저분한 문제는 "5 곱하기 7은 뭐지?"라는 간단한 두뇌 자극제가 아닙니다. 마치 눈가리개를 한 채 퍼즐을 조립하는 것 같은 느낌의 문제입니다. 모든 곳에 조각이 있고 명확한 시작점이 없습니다. 이러한 질문은 여러 곳에서 정보를 끌어와 모든 것을 연결하기 위해 논리적 도약을 요구합니다.

실제 예:
이걸 생각해 보세요: "카니예 웨스트의 'Power'에서 샘플링한 노래를 부른 그룹의 밴드 리더는 몇 년에 태어났을까요?" 이렇게 풀어보세요:
대규모 언어 모델이 복잡한 문제를 처리하는 방법
  • 1단계: "Power"가 King Crimson의 "21st Century Schizoid Man"을 샘플링했다는 것을 인식하세요.
  • 2 단계 : 킹 크림슨의 밴드리더가 로버트 프리프라는 것을 알아보세요.
  • 3단계: 프리프의 출생년도는 1946년입니다.

그건 여러 단계를 거치는 문제예요. 단순히 하나의 사실을 떠올리는 게 아니라, 여러 사실을 연결해서 풀어야 하죠. 단순한 암기가 아니라 추론 능력이 요구되는 문제라서, 법학 석사(LLM)에게 딱 맞는 유형이에요.

왜 까다로운가

지저분한 문제는 음악, 역사, 대중 문화 등 도메인을 가로질러 점을 연결하는 데 의존하기 때문에 모델을 넘어뜨립니다. 링크 하나만 놓치면 답 전체가 무너집니다.

FRAMES 데이터 세트: LLM을 위한 스트레스 테스트

연구진은 논리 학습 모델(LLM)이 다양한 압력 상황에서 어떻게 작동하는지 알아보기 위해 FRAMES 데이터셋을 구축했습니다. 2024년 논문에 발표된 이 데이터셋은 추론, 수학, 논리, 시간 기반 추론 등 다양한 영역을 아우르는 824개의 다단계 문제 들로 구성되어 있습니다 . 예를 들어 과거 단서를 통해 누군가의 나이를 계산하는 문제 등이 있습니다.

FRAMES 데이터 세트 - LLM을 위한 스트레스 테스트
출처: 연구 논문

숫자

최고 수준의 법학 석사들이 도움 없이 FRAMES 문제를 풀었을 때, 약 40%의 정확도를 기록했습니다 . 나쁘지는 않지만, 눈부시게 훌륭한 수치는 아닙니다.

그런 다음 연구원들은 검색 증강 생성 (RAG) 을 통해 외부 정보에 접근할 수 있도록 하여 이들에게 구원의 손길을 내밀었습니다 . 그 결과, 설정에 따라 정확도가 66~73%까지 급증했습니다 . 이는 상당한 도약이며, 적절한 지원이 주어졌을 때 LLM이 훨씬 더 빛을 발한다는 것을 보여줍니다.

깊게 파고

FRAMES 논문은 일부 질문에는 최대 35단계의 추론 단계가 필요하다고 언급합니다. 예를 들어, "역사적 인물이 1945년 사건 당시 3세였고, 그 형제가 1980년 후에 태어났다면, 그 형제는 XNUMX년에 몇 살이었을까요?" 이는 수학, 타임라인 추적, 추론을 하나로 합친 것입니다. 어려운 문제입니다!

검색 증강 생성(RAG): Boost의 기반 기술

RAG 기술이 LLM과 함께 작동하는 방식

RAG는 ​​마치 LLM 과정 학생에게 빠른 연구 조교를 붙여주는 것과 같습니다 . 과정은 다음과 같습니다.

검색 단계: 시스템은 위키피디아, 회사 문서 또는 웹과 같은 데이터베이스를 스캔하여 관련 정보를 찾습니다.
추론 단계: LLM은 질문과 가져온 데이터를 결합하여 답변을 구성합니다.

왜 도움이 되는가

LLM은 모든 사실을 훈련 데이터에 저장하지 않습니다. RAG는 이러한 격차를 메웁니다. FRAMES에서 40% 기준선이 66-73%로 치솟는 것은 멀티홉 추론에 있어 게임 체인저임을 증명합니다.

실제 사례:
RAG가 지원하는 고객 지원 챗봇은 회사의 지식 기반에서 관련 문서를 검색하여 정확한 정보를 생성할 수 있습니다. 컨텍스트 인식 응답 사용자 질의에 대한 답변입니다. 이를 통해 실시간으로 정확하고 개인화된 지원을 보장하여 고객 만족도를 높입니다.

캐치
완벽하지는 않습니다. 검색에서 관련성이 없거나 노이즈가 있는 데이터를 끌어오더라도 LLM은 여전히 ​​그것을 망칠 수 있습니다. YouTube 동영상에서는 모델이 모호한 문서를 잘못 해석하여 어떤 경우에는 정확도가 15% 떨어지는 모습이 나왔습니다.

LLM이 어려움을 겪는 곳

LLM의 어려움 AI 추리

패턴 매칭 vs. 진정한 논리 - 증거

2024 년 MIT CSAIL 연구에 따르면 대규모 언어 모델(LLM)은 익숙한 작업에서는 탁월한 성능을 보이지만, 새로운 시나리오에서는 심각한 어려움을 겪으며 진정한 추론보다는 암기에 더 많이 의존하는 것으로 나타났습니다. 이 연구는 체스 포지션 변경이나 10진법이 아닌 다른 진법을 사용한 산술 연산과 같은 가상 시나리오를 통해 모델을 테스트했으며 , 그 결과 정확도가 급격히 떨어졌습니다.

미래를 주도하는 커뮤니티 혁신 AI 추리

LLM이 지저분하고 현실적인 문제를 해결하도록 하는 노력은 대기업만을 위한 것이 아닙니다. 글로벌하고 대중적인 노력입니다. 초기 인터넷 분위기를 생각해 보세요. 혼란스럽고, 엉성하고, 대담한 아이디어로 가득 차 있습니다. 오픈소스 프로젝트와 분산 작업이 방향을 잡고 있습니다. AI 추리 이 흥미로운 공간으로.

AI 추리

오픈소스 강자들

커뮤니티는 대기업과 경쟁할 수 있는 도구를 쏟아내고 있습니다. 포옹하는 얼굴: 그들의 플랫폼은 다음을 호스팅합니다. 100,000년 모델, 그 중 많은 것이 날카롭게 만들어졌습니다. 추론 과제—여러 단계에 걸쳐 단서를 조각조각 모으는 것과 같습니다. 그들의 트랜스포머 도서관은? 사실상 스위스 군용 칼과 같습니다. AI 지금 조사해보세요.

그리고 EleutherAI 라는 반항적인 팀이 만든 GPT-J 가 있습니다 . GPT-J 는 FRAMES 같은 벤치마크에서 GPT-3와 어깨를 나란히 하는 오픈소스 알고리즘입니다. 이는 단순히 멋진 것을 넘어, 괜찮은 사양의 컴퓨터만 있다면 누구나 LLM이 복잡한 퍼즐을 더 잘 풀도록 도울 수 있다는 것을 증명하는 사례입니다.

분산된 승리

다양성은 혁신을 촉진합니다. 앨런 인공지능 연구소는 LLM(법학 석사)들이 단계별로 추론하도록 하는 까다로운 과학 문제 데이터 세트인 ARC( AI2 Reasoning Challenge ) 를 발표했습니다 . 한편, Kaggle 대회는 전 세계 인재들을 모아 복잡한 문제를 해결하고, 연구실에서 놓칠 수 있는 아이디어들을 쏟아내고 있습니다.

솔로 플레이어도 빛납니다. 2024년 arXiv 논문은 긴 맥락 추론을 15%나 강화한 새로운 주의력 조정을 공개했습니다. 이는 LLM이 얽힌 현실 세계의 문제에 필요한 종류의 우위입니다.

지저분한 문제에 연결하기

지저분한 일(예: 뒤죽박죽된 힌트 더미에서 사실을 파헤치는 일)에는 유연하게 생각하고 점을 연결할 수 있는 LLM이 필요합니다. 커뮤니티 활동은 다음을 통해 이를 실현하고 있습니다.

모델을 거친 추론 과제에 대해 훈련하기 위해 데이터 세트를 제작합니다(ARC를 생각해 보세요).
공유 오픈 모델 (GPT-J와 같이) 누구나 조정할 수 있습니다.
성과를 향상시키는 획기적인 기술(새로운 주의력 관리 방법)을 도입합니다.

이는 단순한 과대광고가 아닙니다. 이는 LLM을 현실 세계에서 숙달하도록 이끄는 엔진입니다.

최종 생각

LLM은 정말 놀랍지만, 복잡한 문제들은 그 한계를 드러냅니다. RAG는 그들에게 큰 활력을 불어넣고, Sentient Chat과 같은 새로운 얼굴들은 앞으로 다가올 일들을 암시합니다. AI 괴짜야, 난 그것이 어떻게 전개되는지 보는 것을 고대하고 있어.

LLM에 던진 지저분한 질문이 있나요? 댓글을 남겨주세요. 여러분의 의견을 듣고 싶습니다.

고수 아이모조 자세한 AI 모험 - 우리는 이제 막 시작일 뿐이야

댓글을 남겨주세요.

이메일 주소는 공개되지 않습니다. 필수 입력 항목은 * 로 표시되어 있습니다.

이 사이트는 Akismet을 사용하여 스팸을 줄입니다. 댓글 데이터 처리 방식에 대해 알아보세요.

또한 Aimojo 부족!

매주 76,200명이 넘는 회원과 함께 비밀 팁을 받아보세요! 
🎁 보너스: $200를 받으세요AI 가입하시면 "마스터리 툴킷"을 무료로 드립니다!

탐색 AI 도구
엔 그램

어떤 제품 문서든 몇 분 만에 게시 가능한 비디오로 변환하세요 The AI 제품 및 마케팅 팀을 위해 제작된 비디오 생성기

젠크리에이터

올인원 AI 완전한 창작의 자유를 원하는 크리에이터를 위한 콘텐츠 스튜디오 제한 없음 AI 이미지, 비디오 및 인플루언서 생성을 단일 크레딧 기반 플랫폼에서 진행합니다.

픽사조 AI

50개 이상의 물건을 갖고 있다고 상상해 보세요. AI 상상하시는 모든 것을 만들어낼 준비가 된 모델들입니다. 하나의 플랫폼. 수백 개의 AI 다양한 기능. 무궁무진한 창작 방식.

피트니스 AI

더 스마트하게 훈련하고, 더 빠르게 발전하세요. The AI 당신이 다음에 들어 올려야 할 무게를 정확히 아는 코치.

오이오이 AI

OiiOii AI로 스튜디오급 애니메이션을 제작하세요 하나의 아이디어를 완벽한 애니메이션으로 만들어보세요

© 저작권 2023 - 2026 | AI 프로 | ♥로 만들었습니다