
ねえ、 AI 愛好家の皆さん!私はAIMOJOの開発者Aliです。チャットボットがかろうじて2つの文を繋ぎ合わせることしかできなかった頃から、人工知能に夢中になってきました。
当時、 AI 何か巨大なもののラフスケッチのように感じましたが、今はどうでしょうか? ChatGPT、Grok、大規模言語モデル(LLM)の最新のブレークスルーなど、毎日驚くような出来事が起こっています。
では、大きな疑問について掘り下げてみましょう。LLM は実際に複雑で厄介な課題をどれだけうまく解決できるのでしょうか?
「厄介な」問題とは何を意味するのでしょうか?
複雑な問題とは、「5 かける 7 はいくつですか?」といった単純な頭の体操ではありません。目隠しをしてジグソーパズルを組み立てているような問題です。ピースがあちこちに散らばっていて、明確な出発点がありません。こうした問題は複数の場所から情報を引き出し、すべてを結び付けるために論理的な飛躍を要求します。

- ステップ 1: 「Power」はキング・クリムゾンの「21st Century Schizoid Man」をサンプリングしていることがわかります。
- ステップ2: キング・クリムゾンのバンドリーダーはロバート・フリップだ。
- ステップ 3: フリップの誕生年は 1946 年であることが判明しました。
これは複数の要素が絡み合う問題です。単に一つの事実を思い出すのではなく、複数の事実を繋ぎ合わせる必要があります。これは丸暗記ではなく、論理的な思考力が求められる問題であり、法学修士課程(LLM)の学生にとって最適なテストと言えるでしょう。
なぜ難しいのか
モデルは、音楽、歴史、ポップカルチャーなど、さまざまな分野をまたいで点と点を結びつける必要があるため、複雑な問題が発生するとモデルがうまく機能しなくなります。1 つのリンクを見逃すと、答え全体が崩れてしまいます。
FRAMES データセット: LLM のストレス テスト
研究者たちは、論理的推論モデル(LLM)がプレッシャーの下でどのように機能するかを検証するために、FRAMESデータセットを構築した。2024年の論文で発表されたこのデータセットは、824の複数ステップからなる問題集である。これらの問題は、推論、数学、論理、そして歴史的な手がかりから人の年齢を計算するといった時間ベースの推論など、幅広い分野を網羅している。

Entrupy
一流の法学修士課程の学生が自力でFRAMES問題に取り組んだところ、正答率は約40%だった。悪くはないが、目覚ましい成績とは言えない。
そこで研究者たちは、検索拡張生成(RAG)による外部情報へのアクセスという救いの手を差し伸べた。その結果、設定にもよるが、精度は66~73%にまで向上した。これは大きな飛躍であり、適切なサポートがあればLLM(言語学習モデル)がより輝きを増すことを示している。
深く掘る
FRAMES 論文では、いくつかの質問には最大 35 つの推論ステップが必要であると指摘しています。たとえば、「歴史上の人物が 1945 年の出来事の時に 3 歳で、その 1980 年後に兄弟が生まれた場合、XNUMX 年の兄弟は何歳だったでしょうか?」これは、数学、タイムラインの追跡、推論が XNUMX つにまとめられた難しい問題です。
検索拡張世代(RAG):ブーストの背後にある技術

RAGは、 LLM(法学修士)取得者に手軽な研究助手を与えるようなものです。その手順は以下のとおりです。
なぜ役立つのか
LLM はトレーニング データにすべての事実を保存しません。RAG はそれらのギャップを埋めます。FRAMES では、40% のベースラインが 66 ~ 73% に急上昇し、マルチホップ推論にとって画期的なものであることを証明しています。
キャッチ
これは絶対確実ではない。検索で無関係なデータやノイズの多いデータが見つかった場合、LLM は失敗する可能性がある。YouTube の動画では、モデルがあいまいな文書を誤って解釈し、場合によっては精度が 15% 低下する様子が紹介されている。
LLMが苦戦する場所

パターンマッチングと真のロジック - 証拠
2024年のMIT CSAILの研究によると、大規模言語モデル(LLM)は馴染みのあるタスクでは優れた性能を発揮するものの、新しいシナリオでは著しく苦戦し、真の推論よりも記憶に頼る傾向があることが明らかになった。この研究では、チェスの局面変更や10進法以外のシステムでの算術計算といった反事実的なタスクでモデルをテストしたところ、精度が劇的に低下した。
コミュニティイノベーションが未来を牽引 AI 推論
現実世界の複雑な問題にLLMが取り組むよう促すのは、大企業だけのものではありません。これは世界的な草の根の取り組みです。初期のインターネットの雰囲気を思い出してください。混沌として、雑然としていて、大胆なアイデアに満ちています。オープンソースプロジェクトと分散型作業が、 AI 推論 このエキサイティングな空間に。

オープンソースの強豪
コミュニティは大手企業に匹敵するツールを生み出している。 ハグ顔: 彼らのプラットフォームは 100,000年モデル、 そのうちの何トンもが 推論タスク複数のステップを踏んで手がかりをつなぎ合わせるようなものだ。彼らのトランスフォーマー図書館?まるでスイスアーミーナイフのようだ。 AI 今すぐ調査してください。
そして、 EleutherAIという反逆者たちの集団が、 FRAMESのようなベンチマークでGPT-3と互角に渡り合うオープンソースの怪物、 GPT-Jを開発した。これは単に素晴らしいだけでなく、そこそこの性能を持つコンピューターさえあれば、誰でもLLM(言語学習者)が複雑なパズルをより賢く解けるように手助けできるという証拠でもある。
分散化の勝利
多様性は画期的な発見の原動力となる。アレン人工知能研究所は、難解な科学問題のデータセットであるARC(AI2 Reasoning Challenge)を発表した。これは、法学修士課程の学生に段階的な推論能力を要求している。一方、Kaggleのコンペティションは、複雑な課題に取り組む世界中の才能ある人材を集め、研究室ですら見落としがちなアイデアを生み出している。
ソロプレイヤーも活躍します。2024 年の arXiv 論文では、ロングコンテキスト推論を 15% 向上させる新しい注意調整が発表されました。これは、複雑な現実の問題に対処するために LLM が必要とする優位性です。
厄介な問題に結び付ける
雑然としたヒントの山から事実を掘り出すような厄介な作業には、柔軟に考え、点と点を結び付けることができる法学修士が必要です。コミュニティの取り組みは、次の方法でこれを実現しています。
これは単なる誇大宣伝ではなく、LLM を現実世界での習得へと導く原動力なのです。
推奨読書:
最終的な考え
LLMは驚異的な学問ですが、複雑な問題に取り組むとその限界が露呈します。RAGはLLMに大きな弾みを与え、Sentient Chatのような新進気鋭の研究者は、近い将来に何が起こるかを示唆しています。 AI オタク、それがどのように展開するかを見るのが待ちきれません。
LLM に対して難しい質問を投げかけてきましたか? コメントを残してください。あなたの意見を聞きたいです。
続ける アイモジョ 詳細については、 AI 冒険は始まったばかり


