رتبهبندی مدلهای استدلالی برای مسئلههای چندمرحلهای
این مدلها قبل از پاسخ، زنجیرهٔ استدلال تولید میکنند. کیفیت روی مسائل چندمرحلهای بالاتر است ولی تعداد توکن خروجی چند برابر میشود؛ برای همین در برآورد هزینه، سه برابر خروجی معمول در نظر گرفته میشود.
بهصرفهترین در این دسته
امتیاز از ۱۰۰: ۵۰٪ ارزانی، ۳۰٪ قابلیتها و ۲۰٪ اندازهٔ context — نه سنجهٔ کیفیت پاسخ.
| # | مدل | context | ≈ ۱٬۰۰۰ کلمه | امتیاز |
|---|---|---|---|---|
| ۱ | Gemini 2.5 Flash Lite (batch) | 1,048,576 | 94 | 86.2 |
| ۲ | Qwen3.7 Flash | 1,000,000 | 60 | 84.9 |
| ۳ | Muse Spark 1.2 Contributor | 1,048,576 | 113 | 84.2 |
| ۴ | Muse Spark 1.3 Contributor | 1,048,576 | 113 | 84.2 |
| ۵ | GPT-5 Nano (batch) | 400,000 | 85 | 83.9 |
| ۶ | Nex-N2-Mini | 262,144 | 47 | 82.9 |
| ۷ | Ling 3.0 Flash | 262,144 | 32 | 81.1 |
| ۸ | GLM Flash Latest | 1,310,720 | 116 | 78.6 |
| ۹ | Gemini 2.5 Flash Lite | 1,048,576 | 189 | 78.6 |
| ۱۰ | GLM 5.3 Flash | 1,310,720 | 123 | 78 |
| ۱۱ | Solar Pro 4 | 524,288 | 57 | 77.2 |
| ۱۲ | Qwen3.5-Flash | 1,000,000 | 123 | 77.1 |
| ۱۳ | DeepSeek V4 Flash Latest | 1,310,720 | 79 | 76.8 |
| ۱۴ | GPT-5 Nano | 400,000 | 170 | 76.4 |
| ۱۵ | Qwen3.5-9B | 262,144 | 94 | 75.4 |
فهرست کامل مدلهای استدلالی برای مسئلههای چندمرحلهای با قیمت ←