
Привет, AI энтузиасты! Меня зовут Али, я создатель AIMOJO, и я увлечен искусственным интеллектом с тех времен, когда чат-боты едва могли связать два предложения.
Тогда, AI Казалось, это грубый набросок чего-то огромного, а теперь? Это ежедневное зрелище — вспомните ChatGPT, Grok и последние достижения в области больших языковых моделей (LLM).
Итак, давайте углубимся в большой вопрос: насколько хорошо обладатели степени магистра права на самом деле могут решать сложные и запутанные задачи?
Что определяет «грязную» проблему?
Запутанные проблемы — это не простые головоломки типа «Сколько будет 5 умножить на 7?». Это те, которые создают ощущение, будто вы собираете пазл с завязанными глазами — повсюду детали, нет четкой отправной точки. Эти вопросы извлекают информацию из нескольких мест и требуют логических скачков, чтобы связать все это вместе.

- Шаг 1: Обратите внимание, что «Power» — это сэмпл из песни «21st Century Schizoid Man» группы King Crimson.
- Шаг 2: Назовите лидера группы King Crimson — Роберта Фриппа.
- Шаг 3: Определите год рождения Фриппа — 1946.
Это вопрос, требующий многократного повторения. Вы не просто вспоминаете один факт, а соединяете цепочку фактов. Это логическое мышление, а не механическое запоминание, и это идеальный тест для магистров права.
Почему это сложно
Запутанные проблемы сбивают модели с толку, поскольку они опираются на соединение точек в разных областях — музыка, история, поп-культура. Пропустите одну ссылку, и весь ответ рухнет.
Набор данных FRAMES: стресс-тест для LLM
Исследователи создали набор данных FRAMES, чтобы проверить, как многоуровневые логические модели (LLM) выдерживают нагрузку. Опубликованный в статье 2024 года, он представляет собой набор из 824 многошаговых вопросов. Они охватывают умозаключения, математику, логику и рассуждения, основанные на времени, — например, вычисление возраста человека по историческим данным.

Цифры
Когда лучшие студенты магистратуры самостоятельно решали задачи из FRAMES, их точность составляла около 40% . Неплохо, но не впечатляюще.
Затем исследователи предоставили им спасательный круг: доступ к внешней информации с помощью метода генерации с расширенным поиском ( Retrieval-Augmented Generation , RAG). Благодаря этому точность подскочила до 66-73% , в зависимости от настроек. Это большой скачок, показывающий, что LLM-системы раскрывают свой потенциал в полной мере при правильной поддержке.
Копаем глубже
В статье FRAMES отмечается, что некоторые вопросы требуют до шести шагов рассуждения. Например: «Если исторической личности было 35 лет во время события 1945 года, а ее брат родился на 3 года позже, сколько лет было брату в 1980 году?» Это математика, отслеживание временной шкалы и вывод в одном флаконе — сложная штука!
Генерация дополненной информации (RAG): технология, лежащая в основе ускорения

Программа RAG — это как дать магистру права (LLM) быстрого помощника по исследованиям . Вот как это происходит:
Почему это помогает
LLM не хранят все факты в своих обучающих данных. RAG заполняет эти пробелы. В FRAMES этот 40% базовый уровень взлетает до 66-73%, что доказывает, что это кардинально меняет ситуацию для многошагового рассуждения.
Поймайте
Это не является гарантией. Если поиск выдает нерелевантные или шумные данные, LLM все равно может его испортить. Видео на YouTube показало, как модель неверно интерпретирует неопределенный документ, что в некоторых случаях снижает точность на 15%.
Где LLM-степени испытывают трудности

Сопоставление шаблонов против истинной логики — доказательства
Исследование MIT CSAIL 2024 года показало, что большие языковые модели (LLM) превосходно справляются со знакомыми задачами, но испытывают значительные трудности в новых сценариях, больше полагаясь на запоминание, чем на подлинное рассуждение. В ходе исследования модели тестировались на контрфактических задачах, таких как измененные шахматные позиции и арифметика в системах с не десятичной системой счисления, где точность резко снизилась.
Инновации сообщества — движущая сила будущего AI аргументация
Стремление заставить LLM решать сложные, реальные проблемы не только для крупных компаний — это глобальные, низовые усилия. Подумайте о ранних интернет-флюидах: хаотичных, беспорядочных и полных смелых идей. Проекты с открытым исходным кодом и децентрализованная работа направляют AI рассуждение в это захватывающее пространство.

Мощные системы с открытым исходным кодом
Сообщества штампуют инструменты, которые могут составить конкуренцию большим собакам. Обнимая лицо: их платформа размещает более модели 100,000 года, тонны которых заточены для задачи на рассуждение— как собирать воедино подсказки на протяжении нескольких шагов. Их библиотека Трансформеров? Это практически швейцарский армейский нож AI исследуйте сейчас.
А ещё есть EleutherAI , команда бунтарей, создавшая GPT-J , мощную программу с открытым исходным кодом, которая на равных конкурирует с GPT-3 в таких бенчмарках, как FRAMES. Это не просто круто — это доказательство того, что любой, у кого есть приличный компьютер, может помочь студентам магистратуры лучше справляться со сложными задачами.
Децентрализованные победы
Разнообразие способствует прорывам. Институт искусственного интеллекта имени Аллена запустил ARC ( AI2 Reasoning Challenge ) — набор данных со сложными научными вопросами, который заставляет студентов магистратуры рассуждать пошагово. Тем временем, соревнования Kaggle привлекают таланты со всего мира для решения сложных задач, выдавая идеи, которые могут быть упущены даже лабораториями.
Игроки-одиночки тоже блистают. В статье arXiv 2024 года была представлена новая настройка внимания, которая оживила рассуждения в длинном контексте на 15%. Именно такие возможности нужны LLM для решения запутанных проблем реального мира.
Связывая это с запутанными проблемами
Запутанные вещи — вроде поиска факта из кучи подсказок — требуют LLM, которые могут мыслить гибко и соединять точки. Усилия сообщества справляются с этим:
Это не просто шумиха — это двигатель, ведущий магистров права к реальному мастерству.
Рекомендуемая литература:
Заключение
LLM — это нечто потрясающее, но запутанные проблемы показывают их пределы. RAG дает им серьезный подъем, а новые лица, такие как Sentient Chat, намекают на то, что ждет их за углом. Как AI чувак, мне не терпится увидеть, чем все это закончится.
У вас есть сложный вопрос, который вы задали LLM? Оставьте комментарий — мне бы хотелось услышать ваше мнение.
Придерживайтесь АЙМОХО для большего AI приключения — мы только начинаем


