Kan store sprogmodeller løse komplekse, rodede udfordringer?

Store sprogmodeller og rodede ræsonnementudfordringer

Hey, AI entusiaster! Jeg er Ali, fyren bag AIMOJO, og jeg har været besat af kunstig intelligens siden dengang, hvor chatbots knap nok kunne sætte to sætninger sammen.

Dengang, AI føltes som en grov skitse af noget enormt, og nu? Det er en daglig kæbedråber – tænk på ChatGPT, Grok og de seneste gennembrud inden for store sprogmodeller (LLM'er).

At køre AIMOJO lader mig jage min passion: at finde ud af, hvad denne teknologi virkelig kan gøre, især når jeg står over for den slags sammenfiltrede problemer i den virkelige verden, der ikke kommer med et snydeark.

Så lad os grave ind i et stort spørgsmål: Hvor godt kan LLM'er faktisk sortere gennem komplicerede, rodede udfordringer?

Hvad definerer et "rodet" problem?

Rodede problemer er ikke dine simple "Hvad er 5 gange 7?" hjerneblødninger. Det er dem, der føles, som om du samler et puslespil med bind for øjnene – brikker overalt, intet klart udgangspunkt. Disse spørgsmål henter information fra flere steder og kræver logiske hop for at binde det hele sammen.

Et rigtigt eksempel:
Tag dette: "Hvilket år blev bandlederen for gruppen, der fremførte sangen samplet i Kanye Wests 'Power' født?" Sådan knækker du det:
Hvordan store sprogmodeller håndterer rodede udfordringer
  • Trin 1: Erkend, at "Power" sampler "21st Century Schizoid Man" af King Crimson.
  • Trin 2: Identificer King Crimsons bandleder som Robert Fripp.
  • Trin 3: Fastgør Fripps fødselsår—1946.

Det er et spørgsmål, der kræver flere hop. Du husker ikke bare én kendsgerning; du syr en kæde af dem sammen. Det er ræsonnement, ikke udenadshukommelse, og det er en perfekt test for LLM'er.

Hvorfor det er svært

Rodede problemer slår modellerne op, fordi de er afhængige af at forbinde prikker på tværs af domæner – musik, historie, popkultur. Gå glip af ét link, og hele svaret falder sammen.

FRAMES-datasættet: En stresstest for LLM'er

Forskere har udviklet FRAMES-datasættet for at se, hvordan LLM'er klarer sig under pres. Det er en samling af 824 spørgsmål i flere trin, som blev offentliggjort i en artikel fra 2024. Disse spænder over inferens, matematik, logik og tidsbaseret ræsonnement – ​​som f.eks. at beregne en persons alder ud fra historiske spor.

Numrene

Da top-LLM'er tacklede FRAMES uden hjælp, scorede de omkring 40% nøjagtighed . Anstændigt, men ikke blændende.

Så gav forskerne dem en livline: adgang til ekstern information via Retrieval-Augmented Generation (RAG). Dermed steg nøjagtigheden til 66-73% , afhængigt af opsætningen. Det er et stort spring, der viser, at LLM'er stråler klarere med den rette støtte.

Grave dybere

FRAMES-papiret bemærker, at nogle spørgsmål kræver op til seks begrundelsestrin. For eksempel: "Hvis en historisk person var 35 under en begivenhed i 1945, og deres søskende blev født 3 år senere, hvor gammel var søskende i 1980?" Det er matematik, tidslinjesporing og slutninger samlet i én – svære ting!

Retrieval-Augmented Generation (RAG): Teknikken bag boostet

Sådan fungerer RAG-teknologi med LLM'er

RAG er som at give en LLM en hurtig forskningsassistent . Her er processen:

Søgefase: Systemet scanner en database – tænk på Wikipedia, virksomhedsdokumenter eller internettet – for at få relevant information.
Begrundelsesfase: LLM kombinerer spørgsmålet med de hentede data og bygger et svar.

Hvorfor det hjælper

LLM'er gemmer ikke alle fakta i deres træningsdata. RAG udfylder disse huller. I FRAMES beviser de 40 % baseline, der stiger til 66-73 %, at det er en game-changer for multi-hop-ræsonnement.

Eksempel fra den virkelige verden:
En kundesupport chatbot drevet af RAG kan hente relevante dokumenter fra en virksomheds vidensbase og generere præcise, kontekstbevidste svar til brugerforespørgsler. Dette sikrer præcis, personlig assistance i realtid, hvilket øger kundetilfredsheden.

Den Catch
Det er ikke idiotsikkert. Hvis søgningen trækker irrelevante eller støjende data, kan LLM stadig flub det. En YouTube-video viste en model, der fejlfortolkede et vagt dokument, hvilket i nogle tilfælde faldt nøjagtigheden med 15 %.

Hvor LLM'er kæmper

LLM'er kæmper i AI Ræsonnement

Mønstermatching vs. ægte logik – beviser

En undersøgelse fra MIT CSAIL i 2024 viste, at store sprogmodeller (LLM'er) udmærker sig ved velkendte opgaver, men kæmper betydeligt med nye scenarier, da de i højere grad er afhængige af udenadslære end af reel ræsonnement. Forskningen testede modeller på kontrafaktiske opgaver, såsom ændrede skakpositioner og aritmetik i ikke-10-basesystemer, hvor nøjagtigheden faldt dramatisk.

Innovation i lokalsamfundet driver fremtiden for AI Ræsonnement

Skub til at få LLM'er til at knække rodede problemer i den virkelige verden er ikke kun for store virksomheder – det er en global græsrodsindsats. Tænk tidlige internetvibes: kaotisk, skrabet og fuld af dristige ideer. Open source-projekter og decentralt arbejde er styrende AI ræsonnement ind i dette spændende rum.

AI Ræsonnement

Open Source kraftværker

Fællesskaber udskærer værktøjer, der konkurrerer med de store hunde. Tage Knusende ansigt: deres platform hosts over 100,000 modeller, tons heraf slibes til ræsonnement opgaver—som at stykke spor sammen på tværs af flere trin. Deres Transformers-bibliotek? Det er praktisk talt den schweiziske lommekniv af AI forskning nu.

Så er der EleutherAI , en gruppe rebeller, der byggede GPT-J , et open source-monster, der går i dybden med GPT-3 på benchmarks som FRAMES. Det er ikke bare fedt – det er et bevis på, at alle med et ordentligt udstyr kan hjælpe LLM'er med at blive klogere på rodede opgaver.

Decentrale vinder

Diversitet fremmer gennembrud. Allen Institute for AI har droppet ARC ( AI2 Reasoning Challenge ) , et datasæt af vanskelige videnskabelige spørgsmål, der tvinger LLM'er til at ræsonnere trin for trin. I mellemtiden tiltrækker Kaggle-konkurrencer globale talenter til at løse komplekse opgaver og spytter ideer ud, som selv laboratorier måske overser.

Solospillere skinner også. Et arXiv-papir fra 2024 afslørede en ny opmærksomhedsjustering, der satte 15 % op for langkontekstræsonnementer. Det er den slags kant, LLM'er har brug for til sammenfiltrede problemer i den virkelige verden.

At binde det til rodede problemer

Rodet ting - som at grave en kendsgerning ud af en rodet bunke af hints - har brug for LLM'er, der kan tænke fleksibelt og forbinde prikker. Fællesskabets indsats klarer dette ved at:

Udarbejdelse af datasæt (tænk ARC) for at træne modeller i vilde ræsonnement-udfordringer.
Deling åbne modeller (som GPT-J) for enhver at justere.
Slip spilskiftende tricks (nye opmærksomhedshacks), der øger ydeevnen.

Dette er ikke kun hype – det er motoren, der driver LLM'er mod mesterskab i den virkelige verden.

Afsluttende tanker

LLM'er er sindssyge, men rodede problemer afslører deres begrænsninger. RAG giver dem et seriøst løft, og friske ansigter som Sentient Chat antyder, hvad der venter lige om hjørnet. Som en AI Nørd, jeg glæder mig til at se, hvordan det hele udspiller sig.

Har du et rodet spørgsmål, du har stillet til en LLM? Smid en kommentar – jeg vil meget gerne høre din mening.

Holde fast i AIMOJO mere AI eventyr – vi er lige begyndt

Giv en kommentar

Din e-mailadresse vil ikke blive offentliggjort. Obligatoriske felter er markeret med *

Dette websted bruger Akismet til at reducere spam. Lær hvordan dine kommentardata behandles.

Deltag i Aimojo Stamme!

Slut dig til 76,200+ medlemmer for insider-tips hver uge! 
🎁 BONUS: Få vores 200 dollarsAI "Mestringsværktøjskasse" GRATIS ved tilmelding!

trending AI Værktøjer
Swapsle

Ucensurerede voksenbilleder og korte klip fra en prompt eller en startramme, vekslet i mønter, der ikke forsvinder. En 18+ AI billed- og videostudie til fiktive voksenscener.

Gushwork AI

Få kvalificerede indgående kundeemner fra Google og AI søgning uden et internt marketingteam. Udført for dig GEO og leadgenerering for B2B-virksomheder.

Monid AI

Giv din agent én wallet og et livekatalog af betalte værktøjer, så den kan hente data, scrape det åbne web, berige leads og generere medier kun når opgaven har brug for det. OpenRouter-lignende gateway til agentværktøjer, faktureret pr. opkald.

LustCrush AI

Byg en beskidt, brugerdefineret ledsager, der rent faktisk husker scenen og sender billeder, der matcher den. Voksenchat først. Visuelle elementer og stemme som backup.

Åbenkode

Open Source AI Kodningsagent, der lægger modelvalg i dine hænder Terminal først. Udbyderuafhængig. Bygget af og for udviklere.

© Ophavsret 2023 - 2026 | Bliv en AI Professionel | Lavet med ♥