Могут ли большие языковые модели решать сложные и запутанные задачи?

Большие языковые модели и проблемы беспорядочного рассуждения

Привет, AI энтузиасты! Меня зовут Али, я создатель AIMOJO, и я увлечен искусственным интеллектом с тех времен, когда чат-боты едва могли связать два предложения.

Тогда, AI Казалось, это грубый набросок чего-то огромного, а теперь? Это ежедневное зрелище — вспомните ChatGPT, Grok и последние достижения в области больших языковых моделей (LLM).

Работая с AIMOJO, я могу следовать своей страсти: выяснять, на что действительно способна эта технология, особенно когда сталкиваюсь со сложными реальными проблемами, которые невозможно решить с помощью шпаргалки.

Итак, давайте углубимся в большой вопрос: насколько хорошо обладатели степени магистра права на самом деле могут решать сложные и запутанные задачи?

Что определяет «грязную» проблему?

Запутанные проблемы — это не простые головоломки типа «Сколько будет 5 умножить на 7?». Это те, которые создают ощущение, будто вы собираете пазл с завязанными глазами — повсюду детали, нет четкой отправной точки. Эти вопросы извлекают информацию из нескольких мест и требуют логических скачков, чтобы связать все это вместе.

Реальный пример:
Возьмем, к примеру: «В каком году родился лидер группы, исполнившей песню, использованную в песне Канье Уэста «Power»?» Вот как бы вы ответили на этот вопрос:
Как большие языковые модели справляются со сложными задачами
  • Шаг 1: Обратите внимание, что «Power» — это сэмпл из песни «21st Century Schizoid Man» группы King Crimson.
  • Шаг 2: Назовите лидера группы King Crimson — Роберта Фриппа.
  • Шаг 3: Определите год рождения Фриппа — 1946.

Это вопрос, требующий многократного повторения. Вы не просто вспоминаете один факт, а соединяете цепочку фактов. Это логическое мышление, а не механическое запоминание, и это идеальный тест для магистров права.

Почему это сложно

Запутанные проблемы сбивают модели с толку, поскольку они опираются на соединение точек в разных областях — музыка, история, поп-культура. Пропустите одну ссылку, и весь ответ рухнет.

Набор данных FRAMES: стресс-тест для LLM

Исследователи создали набор данных FRAMES, чтобы проверить, как многоуровневые логические модели (LLM) выдерживают нагрузку. Опубликованный в статье 2024 года, он представляет собой набор из 824 многошаговых вопросов. Они охватывают умозаключения, математику, логику и рассуждения, основанные на времени, — например, вычисление возраста человека по историческим данным.

Цифры

Когда лучшие студенты магистратуры самостоятельно решали задачи из FRAMES, их точность составляла около 40% . Неплохо, но не впечатляюще.

Затем исследователи предоставили им спасательный круг: доступ к внешней информации с помощью метода генерации с расширенным поиском ( Retrieval-Augmented Generation , RAG). Благодаря этому точность подскочила до 66-73% , в зависимости от настроек. Это большой скачок, показывающий, что LLM-системы раскрывают свой потенциал в полной мере при правильной поддержке.

Копаем глубже

В статье FRAMES отмечается, что некоторые вопросы требуют до шести шагов рассуждения. Например: «Если исторической личности было 35 лет во время события 1945 года, а ее брат родился на 3 года позже, сколько лет было брату в 1980 году?» Это математика, отслеживание временной шкалы и вывод в одном флаконе — сложная штука!

Генерация дополненной информации (RAG): технология, лежащая в основе ускорения

Как технология RAG работает с LLM

Программа RAG — это как дать магистру права (LLM) быстрого помощника по исследованиям . Вот как это происходит:

Фаза поиска: Система сканирует базу данных (например, Википедию, документы компании или Интернет) на предмет релевантной информации.
Фаза рассуждения: LLM объединяет вопрос с полученными данными и строит ответ.

Почему это помогает

LLM не хранят все факты в своих обучающих данных. RAG заполняет эти пробелы. В FRAMES этот 40% базовый уровень взлетает до 66-73%, что доказывает, что это кардинально меняет ситуацию для многошагового рассуждения.

Пример из реального мира:
Чат-бот поддержки клиентов на базе RAG может извлекать соответствующие документы из базы знаний компании и генерировать точные, контекстно-зависимые ответы на запросы пользователей. Это обеспечивает точную, персонализированную помощь в режиме реального времени, повышая удовлетворенность клиентов.

Поймайте
Это не является гарантией. Если поиск выдает нерелевантные или шумные данные, LLM все равно может его испортить. Видео на YouTube показало, как модель неверно интерпретирует неопределенный документ, что в некоторых случаях снижает точность на 15%.

Где LLM-степени испытывают трудности

LLM борется в AI аргументация

Сопоставление шаблонов против истинной логики — доказательства

Исследование MIT CSAIL 2024 года показало, что большие языковые модели (LLM) превосходно справляются со знакомыми задачами, но испытывают значительные трудности в новых сценариях, больше полагаясь на запоминание, чем на подлинное рассуждение. В ходе исследования модели тестировались на контрфактических задачах, таких как измененные шахматные позиции и арифметика в системах с не десятичной системой счисления, где точность резко снизилась.

Инновации сообщества — движущая сила будущего AI аргументация

Стремление заставить LLM решать сложные, реальные проблемы не только для крупных компаний — это глобальные, низовые усилия. Подумайте о ранних интернет-флюидах: хаотичных, беспорядочных и полных смелых идей. Проекты с открытым исходным кодом и децентрализованная работа направляют AI рассуждение в это захватывающее пространство.

AI аргументация

Мощные системы с открытым исходным кодом

Сообщества штампуют инструменты, которые могут составить конкуренцию большим собакам. Обнимая лицо: их платформа размещает более модели 100,000 года, тонны которых заточены для задачи на рассуждение— как собирать воедино подсказки на протяжении нескольких шагов. Их библиотека Трансформеров? Это практически швейцарский армейский нож AI исследуйте сейчас.

А ещё есть EleutherAI , команда бунтарей, создавшая GPT-J , мощную программу с открытым исходным кодом, которая на равных конкурирует с GPT-3 в таких бенчмарках, как FRAMES. Это не просто круто — это доказательство того, что любой, у кого есть приличный компьютер, может помочь студентам магистратуры лучше справляться со сложными задачами.

Децентрализованные победы

Разнообразие способствует прорывам. Институт искусственного интеллекта имени Аллена запустил ARC ( AI2 Reasoning Challenge ) — набор данных со сложными научными вопросами, который заставляет студентов магистратуры рассуждать пошагово. Тем временем, соревнования Kaggle привлекают таланты со всего мира для решения сложных задач, выдавая идеи, которые могут быть упущены даже лабораториями.

Игроки-одиночки тоже блистают. В статье arXiv 2024 года была представлена ​​новая настройка внимания, которая оживила рассуждения в длинном контексте на 15%. Именно такие возможности нужны LLM для решения запутанных проблем реального мира.

Связывая это с запутанными проблемами

Запутанные вещи — вроде поиска факта из кучи подсказок — требуют LLM, которые могут мыслить гибко и соединять точки. Усилия сообщества справляются с этим:

Создание наборов данных (похожих на ARC) для обучения моделей решению сложных логических задач.
разделение открытые модели (например, GPT-J) для настройки любым пользователем.
Использование трюков, которые меняют правила игры (новых приемов привлечения внимания), повышающих производительность.

Это не просто шумиха — это двигатель, ведущий магистров права к реальному мастерству.

Заключение

LLM — это нечто потрясающее, но запутанные проблемы показывают их пределы. RAG дает им серьезный подъем, а новые лица, такие как Sentient Chat, намекают на то, что ждет их за углом. Как AI чувак, мне не терпится увидеть, чем все это закончится.

У вас есть сложный вопрос, который вы задали LLM? Оставьте комментарий — мне бы хотелось услышать ваше мнение.

Придерживайтесь АЙМОХО для большего AI приключения — мы только начинаем

Оставьте комментарий

Ваш адрес электронной почты не будет опубликован. Обязательные поля отмечены *.

Этот сайт использует Akismet для борьбы со спамом. Узнайте, как обрабатываются ваши комментарии.

Присоединяйтесь к команде Aimojo Племя!

Присоединяйтесь к более чем 76,200 XNUMX участникам, чтобы получать инсайдерские советы каждую неделю! 
???? БОНУС: Получите наши 200 долларов “AI «Мастерский набор инструментов» БЕСПЛАТНО при регистрации!

Топ AI Инструменты
Нграм

Превратите любой документ о продукте в готовый к публикации видеоролик за считанные минуты. AI Генератор видеороликов, созданный для продуктовых и маркетинговых команд.

ZenCreator

Все в одном AI Контент-студия для создателей контента, желающих полной творческой свободы. Неограниченный AI Создание изображений, видеороликов и привлечение влиятельных лиц на единой платформе на основе кредитов.

Pixazo AI

Представьте, что вам за 50. AI модели готовы воплотить в жизнь все, что вы только можете себе представить. Одна платформа. Сотни AI Возможности. Бесконечные способы творчества.

Фитнес AI

Тренируйтесь эффективнее. Продвигайтесь быстрее. AI Тренер, который знает, что вам следует поднять в следующий раз.

OiiOii AI

Создавайте анимацию студийного качества с помощью OiiOii AI. Превратите одну идею в полноценную анимацию.