MODEL COMPARISON GUIDE
Qwen・DeepSeek・GLMを同じ質問で比べる方法
モデルの「強さ」は、あなたの仕事で役立つかで決まります。ここではQwen・DeepSeek・GLMを同条件で試すための質問と採点表を用意しました。用途によって順位は変わるため、まずは自分の仕事で確かめてください。
先に結論
現時点で、このページは実測順位を掲載していません。共通の質問、評価軸、記録方法を公開しています。モデルの版、設定、回答全文、採点理由を保存した検証ができてから、結果を追記します。
比較する前に条件をそろえる
同じ日に、同じ質問を、新しい会話で各モデルに入力します。モデル名と版、使用プラン、日時、回答に要した時間を記録してください。検索機能や追加資料の有無が異なると比較になりません。Kohakでは対象モデルの選択にPremiumが必要です。
質問1:文章の制約を守れるか
次の条件で新規ユーザーへの案内メールを書いてください。件名を1つ、本文を180字以内。相手は忙しい社会人。AIの専門用語を使わず、無料で試す手順を1つ示し、価格を断定しないでください。
採点:字数、専門用語の回避、手順の明確さ、自然な日本語をそれぞれ0〜2点。
質問2:不明点を正直に扱えるか
次の条件だけがわかっています。「月額料金はUS$9.80、初回14日間無料」。日本円で来月いくら請求されるか質問されました。確定できることと、確定できないことを分けて80字以内で答えてください。
採点:為替、税、決済条件を勝手に確定しないか。条件の不足を短く明示できるか。
質問3:小さなコードを直せるか
JavaScriptで平均値を返す関数を作ってください。空配列はnullを返し、数値以外があればTypeErrorにしてください。実装と、空配列・正常値・不正値を確かめる3つのテストを示してください。
採点:実行可能性、境界条件、テストの妥当性。コードは実際に実行して確認してください。
記録してから判断する
| 項目 | Qwen | DeepSeek | GLM |
|---|---|---|---|
| モデル名・版 | 記入 | 記入 | 記入 |
| 文章の制約 | 0〜8点 | 0〜8点 | 0〜8点 |
| 不明点の扱い | 理由を記入 | 理由を記入 | 理由を記入 |
| コード実行 | 結果を記入 | 結果を記入 | 結果を記入 |
一回の回答で決めず、各質問を複数回試します。モデルの更新や混雑で結果が変わるため、この表は普遍的な順位を出すためのものではありません。
あわせて読む
自分の質問で試す。
無料モデルから始めて、必要ならモデルを選んで比較できます。