高専の入学者選抜学力検査(数学)の問題を、研究室のMac Studio上で動かしている生成AIに解かせてみました。クラウドのAIではなく、手元のPCの中だけで動くモデル(いわゆるローカルLLM)です。どのモデルが、どのくらい解けて、どのくらい時間がかかるのかを知りたいと思い、10月初めの数日間で計測しました。数学の結果がそろったので、速報としてまとめます。
何をしたか
- 問題:国立高専機構が公開している過去問のPDFです。令和8年度本試験、令和6年度本試験・追試験、令和7年度追試験、令和8年度追試験の5回分を使いました。令和7年度本試験は、AIへの指示文を調整するために使ったので、集計から外しています。
- 入力:問題PDFを画像にしたものと、固定の指示文だけです。文字起こしやヒントは与えていません。ネット検索などの道具も使わせず、共通の条件や図を使う設問のまとまりごとに、毎回新しい会話で解かせました。
- 採点:公表されている正解と配点に照らして採点しました。マークシートは使っていません。全角・半角の違いなどの表記ゆれは、事前に決めた規則で機械的にそろえています。
- 環境:Mac Studio(メモリ96GB)とLM Studioを使いました。Mac Studio(Apple M5 Ultra)は、一般財団法人放送大学教育振興会の2026年度助成事業のために導入したものです。今回の計測は、同事業で使うローカルLLMの性能確認の一環として、授業での運用に支障のない時間帯に行いました。どのモデルも4ビット量子化版で、ファイルの大きさは6〜18GB程度です。
- 回数:同じ問題を3回ずつ解かせ、平均しました。
結果(100点満点、5回分×3回の平均)
| モデル | 平均点 | 3回の平均点の幅 | 1回分を解く時間 |
|---|---|---|---|
| Muse Glimmer(Meta、30B) | 90.8 | 89.2〜93.4 | 約18分 |
| Qwen3.8 27B(Alibaba) | 89.3 | 85.2〜92.6 | 約13分 |
| Gemma 4 31B(Google) | 81.7 | 78.4〜84.4 | 約30分 |
| Qwen3.5 9B(Alibaba) | 73.3 | 71.6〜75.0 | 約29分 |
| (参照)gpt-6.1-sol(OpenAI、クラウド) | 100 | 1回のみ | 1分未満 |
gpt-6.1-solは、ローカルモデルと比べるための参照としてクラウドで1回だけ解かせました。
読み方の注意
- ばらつきがあります。 同じモデル・同じ問題でも、回によって1回分の点数が20点以上動くことがありました。1回だけの結果で順位を決めるのは危ういと感じています。
- 上位2モデルの差は誤差の範囲です。 Muse GlimmerとQwen3.8 27Bは、3回の幅が重なっています。
- 答えが合っていても、書式を守らないことがあります。 Qwen3.5 9Bは答えの多くが合っている一方、指定した書き方を守らないことが多くありました。書き方まで厳しく見ると、約28点です。
- 学習データに含まれている可能性があります。 問題と正解は公開済みです。どのモデルも、学習データにこれらが含まれている可能性を否定できません。gpt-6.1-solの学習データは2026年4月30日までのもので、今回の5回分はすべてそれより前に公開されています。ローカルモデルの学習データの時期は確認できていません。
- 時間は参考値です。 AIが考えた時間を、問題のまとまりごとに足し合わせたものです。
所感
正直なところ、手元のPCで動くモデルが高専入試の数学で9割近く取ることには驚きました。一方で、同じ問題でも回によって答えが変わり、書式を守らないこともあります。以前、AIを測定装置のように疑うという話を書きましたが、今回も「一度の結果を信じる前に、条件をそろえて何度か測る」ことの大切さを実感しました。
今後
英語・社会・国語・理科も同じ方法で計測しています。全教科がそろったら、問ごとの結果、採点プログラム、指示文などをまとめて公開する予定です。問題そのものは再配布しません。公開PDFは国立高専機構のサイトから入手してください。
謝辞
本計測は、一般財団法人放送大学教育振興会 2026年度助成金(課題名「外部APIとローカルLLMの分業による個人情報保護に配慮した物理教育フィードバック自動生成システムの開発と実践」)の支援を受けて行った、ローカルLLMの性能確認の一環です。計測に用いたMac Studioは、同助成により導入しました。この場を借りて御礼申し上げます。