Чи можуть великі мовні моделі вирішити складні, безладні проблеми?

Великі мовні моделі та складні умовиводи

Гей, AI ентузіасти! Я Алі, хлопець, який стоїть за AIMOJO, і я одержимий штучним інтелектом ще з тих часів, коли чат-боти ледве могли скласти два речення докупи.

Тоді назад, AI виглядало як ескіз чогось грандіозного, а тепер? Це щодня вражає — згадайте ChatGPT, Grok та останні прориви в моделях великих мов програмування (LLM).

Запуск AIMOJO дає мені змогу займатися своєю пристрастю: з’ясовувати, що насправді може зробити ця технологія, особливо коли я стикаюся з такими заплутаними проблемами реального світу, які не приходять із шпаргалкою.

Отже, давайте заглибимося в важливе питання: наскільки добре LLM справді можуть розібратися зі складними, заплутаними викликами?

Що визначає «безладну» проблему?

Безладні проблеми – це не просто «Скільки 5 помножити на 7?» головоломки. Це ті, у кого здається, що ти збираєш пазл із зав’язаними очима — скрізь шматочки, без чіткої відправної точки. Ці запитання отримують інформацію з кількох точок і вимагають логічних стрибків, щоб зв’язати все разом.

Справжній приклад:
Візьміть ось що: «У якому році народився лідер гурту, який виконував пісню з пісні «Power» Каньє Веста?» Ось як це можна зламати:
Як великі мовні моделі справляються зі складними викликами
  • крок 1: Визнайте, що «Влада» є прикладом «Шизоїдної людини 21 століття» Кінга Кримсона.
  • Крок 2: Упізнайте лідера King Crimson як Роберта Фріппа.
  • крок 3: Вкажіть рік народження Фріппа — 1946.

Це питання з кількома етапами. Ви не просто згадуєте один факт, ви зшиваєте ланцюжок з них. Це міркування, а не механічне запам'ятовування, і це ідеальний тест для магістра права (LLM).

Чому це складно

Безладні проблеми спотикають моделей, оскільки вони покладаються на з’єднання точок у різних сферах — музика, історія, поп-культура. Пропустіть одне посилання, і вся відповідь згорнеться.

Набір даних FRAMES: стрес-тест для LLM

Дослідники створили набір даних FRAMES, щоб побачити, як LLM витримують навантаження. Опублікований у статті 2024 року, він являє собою збірку з 824 багатоетапних питань. Вони охоплюють логічний висновок, математику, логіку та міркування на основі часу, такі як обчислення віку людини за історичними підказками.

Цифри

Коли провідні магістра права (LLM) самостійно розв'язували завдання FRAMES, їхня точність становила близько 40% . Пристойно, але не вражаюче.

Тоді дослідники надали їм рятівне коло: доступ до зовнішньої інформації через Retrieval-Augmented Generation (RAG). Завдяки цьому точність зросла до 66-73% , залежно від налаштувань. Це великий стрибок, який показує, що LLM сяють ще яскравіше за умови правильної підтримки.

Копаємо глибше

У документі FRAMES зазначається, що деякі запитання вимагають до шести кроків міркування. Наприклад: «Якщо історичній особі було 35 років під час події 1945 року, а їхній рідний брат народився через 3 роки, скільки років було братові або сестрі у 1980 році?» Це математика, відстеження часової шкали та висновки в одному — складна штука!

Retrieval-Augmented Generation (RAG): технологія, що стоїть за прискоренням

Як технологія RAG працює з LLM

RAG — це як швидко надати LLM-спеціалісту помічника з досліджень . Ось процес:

Фаза пошуку: система сканує базу даних — наприклад, Вікіпедію, документацію компанії чи Інтернет — на пошук відповідної інформації.
Фаза міркування: LLM поєднує запитання з отриманими даними та створює відповідь.

Чому це допомагає

LLM не зберігають усі факти у своїх навчальних даних. RAG заповнює ці прогалини. У FRAMES ці 40% базового рівня, що зросли до 66-73%, доводять, що це кардинально змінює правила для міркування з кількома переходами.

Реальний приклад:
Чат-бот підтримки клієнтів на базі RAG може отримувати відповідні документи з бази знань компанії та генерувати точні, відповіді з урахуванням контексту на запити користувачів. Це забезпечує точну персоналізовану допомогу в режимі реального часу, підвищуючи задоволеність клієнтів.

Піймайте
Це не надійно. Якщо під час пошуку витягуються нерелевантні або шумні дані, LLM все одно може помилити їх. Відео на YouTube показало, що модель неправильно інтерпретує нечіткий документ, що в деяких випадках втрачає точність на 15%.

Де борються магістратури

Боротьба з LLM у AI Обґрунтування

Зіставлення шаблонів проти істинної логіки-доказів

Дослідження MIT CSAIL 2024 року показало, що моделі великих мов (LLM) чудово справляються зі знайомими завданнями, але мають значні труднощі з новими сценаріями, більше покладаючись на запам'ятовування, ніж на справжні міркування. У дослідженні моделі тестувалися на контрфактуальних завданнях, таких як зміна шахових позицій та арифметика в системах числення, відмінних від 10, де точність різко знизилася.

Інновації в громаді, що рухають майбутнє AI Обґрунтування

Поштовх до того, щоб змусити магістерів права вирішувати складні реальні проблеми не лише для великих компаній — це глобальна низова робота. Подумайте про ранні настрої в Інтернеті: хаотичні, уривчасті та повні сміливих ідей. Керують проектами з відкритим кодом і децентралізованою роботою AI міркування у цей захоплюючий простір.

AI Обґрунтування

Електростанції з відкритим кодом

Спільноти створюють інструменти, які конкурують з великими собаками. Візьміть Обіймати обличчя: їхні хости на платформі 100,000 моделі, тонни яких заточені на завдання на міркування— як складання підказок за кілька кроків. Їхня бібліотека Трансформерів? Це практично швейцарський армійський ніж AI дослідження зараз.

А ще є EleutherAI , команда бунтівників, які створили GPT-J , платформу з відкритим кодом, яка нарівні з GPT-3 конкурує за результатами тестів, таких як FRAMES. Це не просто круто — це доказ того, що будь-хто з пристойним обладнанням може допомогти LLM стати розумнішими у складних головоломках.

Децентралізовані перемоги

Різноманітність сприяє проривам. Інститут штучного інтелекту Аллена відмовився від ARC ( AI2 Reasoning Challenge ) – набору даних зі складних наукових питань, який змушує магістраів права міркувати крок за кроком. Тим часом, змагання Kaggle залучають таланти з усього світу для вирішення складних завдань, пропонуючи ідеї, які можуть пропустити навіть лабораторії.

Сольні гравці також сяють. У статті arXiv за 2024 рік було оприлюднено нове налаштування уваги, яке на 15% покращило міркування в довгому контексті. Це те, що потрібно LLM-ам для вирішення заплутаних проблем реального світу.

Пов’язуючи це з безладними проблемами

Для заплутаних речей, як-от викопування факту з переплутаної купи підказок, потрібні LLM, здатні гнучко мислити та з’єднувати точки. Зусилля спільноти досягають цього:

Створення наборів даних (наприклад, ARC) для навчання моделей на викликах дикого міркування.
Поділ відкриті моделі (наприклад, GPT-J), щоб кожен міг налаштувати.
Відмовтеся від трюків, що змінюють гру (нових хаків для уваги), які підвищують продуктивність.

Це не просто ажіотаж — це двигун, який спонукає магістерів права до майстерності в реальному світі.

Заключні думки

Програми магістратури з права (LLM) вражають, але складні проблеми розкривають їхні межі. RAG дає їм серйозний поштовх, а нові обличчя, такі як Sentient Chat, натякають на те, що чекає за рогом. Як AI Гік, мені не терпиться побачити, як все це буде.

Маєте заплутане запитання, яке ви закинули LLM? Напишіть коментар — я хотів би почути вашу думку.

Дотримуватися AIMOJO більше AI пригоди — ми тільки починаємо

залишити коментар

Ваша адреса електронної пошти не буде опублікована. Обов'язкові поля позначені *

Цей сайт використовує Akismet для зменшення спаму. Дізнайтеся, як обробляються дані ваших коментарів.

Реєстрація Aimojo Плем'я!

Приєднуйтеся до 76,000 XNUMX+ учасників, щоб щотижня отримувати поради від інсайдерів! 
🎁 БОНУС: Отримайте наші 200 доларівAI «Набір інструментів майстерності» БЕЗКОШТОВНО при реєстрації!

Тенденції AI Інструменти
Музейно

Все в одному AI Творча студія для створення музики, відео та зображень Перетворюйте текстові підказки на професійні пісні, кінематографічні відео та приголомшливі візуальні ефекти

Ясний

AI Потужний перевірник фактів, детектор шахрайства та верифікатор контенту Друга думка щодо всього, що ви бачите в Інтернеті.

Грок Бот

Ви завжди увімкнені AI Робоча сила, яка завершує роботу Платформа автономних агентів для продуктивності бізнесу та автоматизації завдань

Гіпер3D

Перетворіть будь-яке зображення чи текстову підказку на 3D-ресурс виробничого рівня за лічені секунди Команда AI Генератор 3D-моделей, створений для розробників ігор, команд розробників продуктів та кінематографістів

Mapify

Перетворіть будь-який контент на структуровані ментальні карти за лічені секунди за допомогою штучного інтелекту Найрозумніший AI інструмент для створення ментальних карт та узагальнень для професіоналів та учнів.

© Авторське право 2023 - 2026 | Стати AI Професіонал | Зроблено з ♥