
Гей, AI ентузіасти! Я Алі, хлопець, який стоїть за AIMOJO, і я одержимий штучним інтелектом ще з тих часів, коли чат-боти ледве могли скласти два речення докупи.
Тоді назад, AI виглядало як ескіз чогось грандіозного, а тепер? Це щодня вражає — згадайте ChatGPT, Grok та останні прориви в моделях великих мов програмування (LLM).
Отже, давайте заглибимося в важливе питання: наскільки добре LLM справді можуть розібратися зі складними, заплутаними викликами?
Що визначає «безладну» проблему?
Безладні проблеми – це не просто «Скільки 5 помножити на 7?» головоломки. Це ті, у кого здається, що ти збираєш пазл із зав’язаними очима — скрізь шматочки, без чіткої відправної точки. Ці запитання отримують інформацію з кількох точок і вимагають логічних стрибків, щоб зв’язати все разом.

- крок 1: Визнайте, що «Влада» є прикладом «Шизоїдної людини 21 століття» Кінга Кримсона.
- Крок 2: Упізнайте лідера King Crimson як Роберта Фріппа.
- крок 3: Вкажіть рік народження Фріппа — 1946.
Це питання з кількома етапами. Ви не просто згадуєте один факт, ви зшиваєте ланцюжок з них. Це міркування, а не механічне запам'ятовування, і це ідеальний тест для магістра права (LLM).
Чому це складно
Безладні проблеми спотикають моделей, оскільки вони покладаються на з’єднання точок у різних сферах — музика, історія, поп-культура. Пропустіть одне посилання, і вся відповідь згорнеться.
Набір даних FRAMES: стрес-тест для LLM
Дослідники створили набір даних FRAMES, щоб побачити, як LLM витримують навантаження. Опублікований у статті 2024 року, він являє собою збірку з 824 багатоетапних питань. Вони охоплюють логічний висновок, математику, логіку та міркування на основі часу, такі як обчислення віку людини за історичними підказками.

Цифри
Коли провідні магістра права (LLM) самостійно розв'язували завдання FRAMES, їхня точність становила близько 40% . Пристойно, але не вражаюче.
Тоді дослідники надали їм рятівне коло: доступ до зовнішньої інформації через Retrieval-Augmented Generation (RAG). Завдяки цьому точність зросла до 66-73% , залежно від налаштувань. Це великий стрибок, який показує, що LLM сяють ще яскравіше за умови правильної підтримки.
Копаємо глибше
У документі FRAMES зазначається, що деякі запитання вимагають до шести кроків міркування. Наприклад: «Якщо історичній особі було 35 років під час події 1945 року, а їхній рідний брат народився через 3 роки, скільки років було братові або сестрі у 1980 році?» Це математика, відстеження часової шкали та висновки в одному — складна штука!
Retrieval-Augmented Generation (RAG): технологія, що стоїть за прискоренням

RAG — це як швидко надати LLM-спеціалісту помічника з досліджень . Ось процес:
Чому це допомагає
LLM не зберігають усі факти у своїх навчальних даних. RAG заповнює ці прогалини. У FRAMES ці 40% базового рівня, що зросли до 66-73%, доводять, що це кардинально змінює правила для міркування з кількома переходами.
Піймайте
Це не надійно. Якщо під час пошуку витягуються нерелевантні або шумні дані, LLM все одно може помилити їх. Відео на YouTube показало, що модель неправильно інтерпретує нечіткий документ, що в деяких випадках втрачає точність на 15%.
Де борються магістратури

Зіставлення шаблонів проти істинної логіки-доказів
Дослідження MIT CSAIL 2024 року показало, що моделі великих мов (LLM) чудово справляються зі знайомими завданнями, але мають значні труднощі з новими сценаріями, більше покладаючись на запам'ятовування, ніж на справжні міркування. У дослідженні моделі тестувалися на контрфактуальних завданнях, таких як зміна шахових позицій та арифметика в системах числення, відмінних від 10, де точність різко знизилася.
Інновації в громаді, що рухають майбутнє AI Обґрунтування
Поштовх до того, щоб змусити магістерів права вирішувати складні реальні проблеми не лише для великих компаній — це глобальна низова робота. Подумайте про ранні настрої в Інтернеті: хаотичні, уривчасті та повні сміливих ідей. Керують проектами з відкритим кодом і децентралізованою роботою AI міркування у цей захоплюючий простір.

Електростанції з відкритим кодом
Спільноти створюють інструменти, які конкурують з великими собаками. Візьміть Обіймати обличчя: їхні хости на платформі 100,000 моделі, тонни яких заточені на завдання на міркування— як складання підказок за кілька кроків. Їхня бібліотека Трансформерів? Це практично швейцарський армійський ніж AI дослідження зараз.
А ще є EleutherAI , команда бунтівників, які створили GPT-J , платформу з відкритим кодом, яка нарівні з GPT-3 конкурує за результатами тестів, таких як FRAMES. Це не просто круто — це доказ того, що будь-хто з пристойним обладнанням може допомогти LLM стати розумнішими у складних головоломках.
Децентралізовані перемоги
Різноманітність сприяє проривам. Інститут штучного інтелекту Аллена відмовився від ARC ( AI2 Reasoning Challenge ) – набору даних зі складних наукових питань, який змушує магістраів права міркувати крок за кроком. Тим часом, змагання Kaggle залучають таланти з усього світу для вирішення складних завдань, пропонуючи ідеї, які можуть пропустити навіть лабораторії.
Сольні гравці також сяють. У статті arXiv за 2024 рік було оприлюднено нове налаштування уваги, яке на 15% покращило міркування в довгому контексті. Це те, що потрібно LLM-ам для вирішення заплутаних проблем реального світу.
Пов’язуючи це з безладними проблемами
Для заплутаних речей, як-от викопування факту з переплутаної купи підказок, потрібні LLM, здатні гнучко мислити та з’єднувати точки. Зусилля спільноти досягають цього:
Це не просто ажіотаж — це двигун, який спонукає магістерів права до майстерності в реальному світі.
Рекомендована література:
Заключні думки
Програми магістратури з права (LLM) вражають, але складні проблеми розкривають їхні межі. RAG дає їм серйозний поштовх, а нові обличчя, такі як Sentient Chat, натякають на те, що чекає за рогом. Як AI Гік, мені не терпиться побачити, як все це буде.
Маєте заплутане запитання, яке ви закинули LLM? Напишіть коментар — я хотів би почути вашу думку.
Дотримуватися AIMOJO більше AI пригоди — ми тільки починаємо


