← 最新の論文
💻 computer science

NEDOQwen: Diagnosing and Repairing a Turkish-Centric 0.824B Language Model

本論文は、内部評価と外部評価のミスマッチを診断し、ファインチューニングと修復を通じて標的としたベンチマークの向上を達成するための低コストで監査可能なワークフローを実証するために、トルコ語中心の824Mパラメータ言語モデルであるNEDOQwenを紹介するが、同時に、そのような向上が広範な能力に等しいものではないことについても注意を促すものである。

原著者: Ahmet Rıfat Öztürk, Yağız Ekrem Dalar, Nedim Mutlu Sezer, Feyzi Arda Salihoğlu

公開日 2026-07-20
📖 1 分で読めます☕ さくっと読める

原著者: Ahmet Rıfat Öztürk, Yağız Ekrem Dalar, Nedim Mutlu Sezer, Feyzi Arda Salihoğlu

原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

極小の脳内ボットたちの秘密の生活

コンピューターが単に英語を話すだけでなく、フランス語からスワヒリ語、トルコ語に至るまで、何千もの他の言語を学ぼうとしている世界を想像してみてください。これは人工知能(AI)、特に**自然言語処理(NLP)**と呼ばれる分野の最前線です。これらのAIモデルを、インターネット上のほぼすべての内容を読み込んだ巨大なデジタル脳だと考えてください。彼らはパターンを学習します。例えば、「猫がマットの上に座って……」と言えば、次にくる言葉はおそらく「マット(mat)」であることを彼らは知っています。

しかし、ここからが厄介なところです。すべての脳が平等に作られているわけではありません。あらゆる本が収められた図書館を持つスーパーコンピューターのように巨大なものもあれば、**小型言語モデル(SLM)*のように、ポケットサイズのノートのようなものもあります。これらは構築コストが安く、動作も速いため、特定のタスクや、英語ほど注目されていない言語に最適です。しかし、モデルが言語を学習しているように見えて*も、それが実際に理解しているとは限りません。言葉の意味を知らずに、単に言葉の形を暗記しているだけかもしれませんし、問題を解く代わりに、最も人気のある回答の文字を推測することでテストでカンニングをしているのかもしれません。

研究者たちは、特に、標準的なコンピュータープログラムを混乱させる可能性のある独特の「積み木方式」の文法を持つトルコ語のような言語において、いかにしてこれらの小さくて手頃な価格のAIの脳をより賢く、より正直にするかについて、常に模索しています。大きな問いはこうです。「私たちは、小さな苦戦しているAIモデルを修正して、その言語を真に理解させることができるのか、それとも、単にふりをすることを学んでいるだけなのか?」


NEDOQwenの物語:トルコ語チューターの改造劇

トルコ語を話すために特別に設計された、パラメータ数0.824バイリアンの極小AIモデル、NEDOQWENを紹介しましょう。これは、トルコ語を学ぼうとしているものの、基礎で苦戦している学生のようなものです。Ethosoftの研究チームは、厳格だが親切なチューターの役割を果たすことに決めました。彼らは単に学生がテストに合格できるかどうかを見たいのではなく、なぜ学生が失敗しているのか、そして根本的な問題を本当に解決できるのかを確認するために、完全な「診断と修理」を行いたいと考えたのです。

診断:単に答えを知っているだけではない

まず、研究者たちはNEDOQwenに一連のテストを実施しました。彼らは2つの点を確認しました。チャットにおける指示への従順さ(内部診断)、および数学や歴史といった学校の科目に関する多肢選択式問題への回答能力(外部ベンチマーク)です。

ここで驚きの事実が判明しました。モデルはチャットが上手くなっていたのです!研究者が「クリーンな」指示セットを与えると、会話の中で愚かなミスをしなくなりました。より礼儀正しくなり、ルールに従うようになりました。しかし、難しい多肢選択式のテストに切り替えると、モデルは依然としてひどい状態でした。トルコ語の数学・科学テスト(TurkishMMLU-sub)では約18.11%、一般知識テスト(TUMLU-mini)では**21.33%のスコアでした。比較のために言えば、ランダムに推測した場合の正解率は約20%または25%**です。モデルは辛うじて運に勝っている程度でした。

研究者たちはまた、トークナイザーと呼ばれるAIの「語彙ツール」もチェックしました。これは、文章を理解可能な塊に分解するAIの一部です。彼らは、NEDOQwenはトルコ語専用に設計されているにもかかわらず、そのツールが他の汎用ツールよりもトルコ語の単語の分解においてむしろ劣っていることを発見しました。それはいくつかの単語を「未知(UNK)」として残し、同じことを言うためにより多くの塊を必要としていました。それはまるで、単語の半分が欠けていて、定義も混乱している辞書を学生に与えているようなものでした。

修理:モデルにカンニングを教える(そしてそれを直す)

そこで、チームは修正を試みました。彼らはモデルに特別な「修理」コースを与えました。これは単に知識を教えることではなく、どのようにテストを受けるかを教えることでした。彼らは、正しい回答の文字(A、B、C、またはD)の選び方や、回答の形式の作り方を例示しました。

彼らはこの修理を600ステップ(短期間の学習)行いました。結果は興味深いものでした。

  • TurkishMMLU-sub のスコアは 18.11% から 21.00% に上昇しました。
  • TUMLU-mini のスコアは 21.33% から 32.22% へと跳ね上がりました。

モデルは賢くなっているように見えました!しかし、研究者がさらに深く掘り下げると、隠れたトリックが見つかりました。モデルは必ずしも新しい事実を学んでいるのではなく、キャリブレーション(調整)を学んでいるのだと気づいたのです。修理前、モデルは文字のCに執着していました。あるテストでは、回答の**85.9%**で「C」と推測していたのです!それは基本的に「C推測マシン」でした。

修理後、「C」への執着は減り、モデルは「D」をより頻繁に選ぶようになりました。研究者は、新しい事実を一切教えず、単に回答の文字の選び方だけを教えるという特別なテストを行いました。それだけでさえ、スコアは 19.56%27.00% に上昇しました。これにより、改善の大部分は、モデルが突然トルコの歴史や数学について多くを知ったことによるのではなく、毎回同じ文字を推測するのをやめることを学んだことによるものであることが証明されました。

判定:優れた学生ではあるが、天才ではない

最終的な判定は、朗報と現実的な警告が混ざり合ったものでした。修理は機能しましたが、部分的なものでした。モデルは「C推測マシン」であることをやめ、CDの間で推測を分散させるようになりました(それぞれ約47.6%51.6%)。モデルはテストの形式に従うのが上手くなりました。

しかし、このモデルはトルコの天才ではありません。数学、翻訳、物語の要約においては依然として失敗しています。質問の言い回しが少し変わるだけで、依然として間違いを犯します。研究者たちは、これが実世界で使える「最先端(state-of-the-art)」のモデルではないことを強調しています。これは、低コストで透明性の高い実験なのです。

彼らが発見した最も重要なことは、テストのスコアが高いことが、必ずしもAIが賢くなったことを意味しないということです。時には、単にAIがテストの受け方を学んだだけであることもあります。この事実を明らかにすることで、チームは他の研究者のための新しい「ワークフロー」を作り上げました。内部チャットをチェックし、外部テストをチェックし、トークナイザーをチェックし、そしてモデルが何度も同じ文字を推測しているだけではないかを確認することです。

結局のところ、NEDOQwenは誠実さについての教訓となっています。これは、英語以外の小型AIモデルに対して、スコアのわずかな上昇を大きな突破口として祝うのではなく、慎重になる必要があることを示しています。代わりに、モデルが実際に学習しているのか、それとも単にゲームのルールを学んでいるだけなのか、その「中身」を見る必要があります。研究者たちは、これらの真実を見つけ出すために、わずか0.465 GPU時間(約28分間のコンピュータ稼働時間)とごくわずかな費用しか費やしていません。これは、壊れたAIを診断するためにスーパーコンピューターは必要なく、優れた顕微鏡と懐疑的な目があれば十分であることを証明しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →