قیمت API مدلهای هوش مصنوعی به تومان — مقایسهٔ GPT-5، Claude، Gemini، DeepSeek
جدول قیمت ۱۷ مدل به تومان بهازای هر یک میلیون توکن ورودی و خروجی، هزینهٔ واقعی یک درخواست فارسی، سه سناریوی ماهانه و راههای عملی کمکردن هزینه.

وقتی قیمت مدلها را بهازای «یک میلیون توکن» میبینی، تصور اینکه اپلیکیشن تو ماهانه چقدر خرج میکند سخت است. این مقاله قیمت تومانی مدلهای پرکاربرد را کنار هم میگذارد، با یک درخواست فارسی واقعی حساب میکند که هر مدل چند تومان میگیرد، و بعد سه محصول فرضی را تا رقم ماهانه جلو میبرد. اعداد این مقاله در تاریخ ۱۶ شهریور ۱۴۰۵ از کاتالوگ زندهٔ ما برداشته شده و بهطور منظم بهروز میشود؛ قیمت لحظهای هر مدل همیشه در صفحهٔ همان مدل (مثلاً GPT-5) و از طریق GET /v1/models در دسترس است و همان مرجع نهایی است، نه این جدول.
واحدها را درست بخوان
هر مدل دو قیمت دارد: یکی برای توکنهای ورودی (هر چیزی که تو میفرستی: پیام system، سؤال کاربر، تاریخچهٔ گفتگو، محتوای فایل) و یکی برای توکنهای خروجی (هر چیزی که مدل تولید میکند، از جمله توکنهای استدلال در مدلهای reasoning). قیمتها بهازای یک میلیون توکن اعلام میشود چون عدد یک توکن آنقدر کوچک است که خواندنی نیست؛ ولی صورتحساب واقعی تو بهازای همان چند صد توکنِ هر درخواست محاسبه میشود، با دقت تا کسر تومان.
در پاسخ GET /v1/models/openai/gpt-5 بلوک pricing را میبینی که همهٔ اجزای قیمت را به تومان بهازای هر توکن میدهد و فیلد pricing_currency با مقدار IRT تأکید میکند که واحد تومان است. برای رسیدن به عدد «هر یک میلیون» کافی است در یک میلیون ضرب کنی. هر پاسخ غیراستریم هم هدر X-Uttapen-Cost-Toman دارد که هزینهٔ همان درخواست را دقیق میگوید؛ این هدر بهترین ماشینحساب است.
جدول قیمت به تومان
ستون آخر هزینهٔ یک درخواست معمولی فارسی است: حدود ۱٬۰۰۰ کلمه ورودی (پیام system بهاضافهٔ سؤال کاربر و کمی تاریخچه) که با توکنایزر o200k_base تقریباً ۱٬۷۸۰ توکن میشود، و ۵۰۰ کلمه پاسخ که حدود ۸۹۰ توکن است. چرا فارسی اینقدر توکن میخورد را در مقالهٔ توکن با اعداد واقعی نشان دادهایم.
| مدل | ورودی (تومان / ۱M توکن) | خروجی (تومان / ۱M توکن) | هر ۱٬۰۰۰ کلمهٔ فارسی ≈ |
|---|---|---|---|
openai/gpt-5 | ۱۶۴٬۸۴۴ | ۱٬۳۱۸٬۷۵۰ | ۱٬۴۶۷ تومان |
openai/gpt-5-mini | ۳۲٬۹۶۹ | ۲۶۳٬۷۵۰ | ۲۹۳ تومان |
openai/gpt-5-nano | ۶٬۵۹۴ | ۵۲٬۷۵۰ | ۵۹ تومان |
openai/gpt-4.1 | ۲۶۳٬۷۵۰ | ۱٬۰۵۵٬۰۰۰ | ۱٬۴۰۸ تومان |
openai/gpt-4o-mini | ۱۹٬۷۸۱ | ۷۹٬۱۲۵ | ۱۰۶ تومان |
anthropic/claude-opus-4.1 | ۱٬۹۷۸٬۱۲۵ | ۹٬۸۹۰٬۶۲۵ | ۱۲٬۳۲۴ تومان |
anthropic/claude-sonnet-4.5 | ۳۹۵٬۶۲۵ | ۱٬۹۷۸٬۱۲۵ | ۲٬۴۶۵ تومان |
anthropic/claude-haiku-4.5 | ۱۳۱٬۸۷۵ | ۶۵۹٬۳۷۵ | ۸۲۲ تومان |
google/gemini-2.5-pro | ۱۶۴٬۸۴۴ | ۱٬۳۱۸٬۷۵۰ | ۱٬۴۶۷ تومان |
google/gemini-2.5-flash | ۳۹٬۵۶۳ | ۳۲۹٬۶۸۸ | ۳۶۴ تومان |
google/gemini-2.5-flash-lite | ۱۳٬۱۸۸ | ۵۲٬۷۵۰ | ۷۰ تومان |
deepseek/deepseek-chat-v3.1 | ۷۲٬۵۳۱ | ۲۱۷٬۵۹۴ | ۳۲۳ تومان |
deepseek/deepseek-chat | ۴۲٬۲۰۰ | ۱۱۷٬۳۶۹ | ۱۸۰ تومان |
deepseek/deepseek-r1 | ۹۲٬۳۱۳ | ۳۲۹٬۶۸۸ | ۴۵۸ تومان |
qwen/qwen3-coder | ۳۹٬۵۶۳ | ۱۳۱٬۸۷۵ | ۱۸۸ تومان |
moonshotai/kimi-k2 | ۷۵٬۱۶۹ | ۳۰۳٬۳۱۳ | ۴۰۴ تومان |
meta-llama/llama-3.3-70b-instruct | ۱۳٬۱۸۸ | ۴۲٬۲۰۰ | ۶۱ تومان |
قیمتها بهطور منظم بهروز میشوند؛ عدد زنده همیشه روی صفحهٔ هر مدل است.
چند چیز از همین جدول بیرون میزند. اول اینکه فاصلهٔ ارزانترین و گرانترین مدل بیش از دویست برابر است؛ انتخاب مدل مهمترین تصمیم مالی محصول توست، مهمتر از هر بهینهسازی پرامپت. دوم اینکه توکن خروجی همیشه چند برابر ورودی قیمت دارد (برای GPT-5 هشت برابر، برای Claude پنج برابر)؛ پس پاسخهای بیدلیل بلند بیشتر از پرامپتهای بلند خرج دارند. سوم اینکه GPT-5 و Gemini 2.5 Pro دقیقاً یک قیمت دارند و DeepSeek V3 با یکهشتم قیمت GPT-5 mini، برای بسیاری از کارهای ساده بهاندازهٔ کافی خوب است.
رتبهبندی از ارزان به گران، برای همان درخواست فارسی
اگر فقط عدد ستون آخر را مرتب کنی، سه دستهٔ طبیعی میبینی:
- زیر ۱۰۰ تومان: GPT-5 nano، Llama 3.3 70B، Gemini 2.5 Flash Lite. برای دستهبندی، استخراج فیلد، تشخیص زبان، پاسخهای قالبی و هر جایی که حجم زیاد و پیچیدگی کم است.
- ۱۰۰ تا ۵۰۰ تومان: GPT-4o mini، DeepSeek V3، Qwen3 Coder، GPT-5 mini، DeepSeek V3.1، Gemini 2.5 Flash، Kimi K2، DeepSeek R1. اینجا بیشترین محصولهای واقعی زندگی میکنند: چت پشتیبانی، تولید محتوای پیشنویس، خلاصهسازی، کدنویسی روزمره.
- بالای ۸۰۰ تومان: Claude Haiku 4.5، GPT-4.1، GPT-5، Gemini 2.5 Pro، Claude Sonnet 4.5، و در انتها Claude Opus 4.1 با اختلاف زیاد. برای استدلال چندمرحلهای، بازبینی کد، متنهای حساس و جایی که یک خطا از صد درخواست گرانتر است.
نکتهٔ مهم: این رتبهبندی برای الگوی «ورودی دو برابر خروجی» است. اگر کارت خلاصهسازی است (ورودی خیلی بزرگ، خروجی کوچک)، مدلهایی که ورودی ارزان دارند جلو میافتند؛ اگر تولید متن بلند است، قیمت خروجی تعیینکننده میشود و فاصلهها بیشتر باز میشود.
هزینه در مقیاس: سه سناریوی واقعی
عدد یک درخواست به تنهایی معنا ندارد؛ بگذار سه محصول فرضی را حساب کنیم. در هر سه، همان درخواست ۱٬۰۰۰ کلمهای بالا مبنای محاسبه است مگر اینکه خلافش گفته شود.
پشتیبانی هوشمند یک فروشگاه با ۳٬۰۰۰ گفتگو در ماه. با google/gemini-2.5-flash میشود حدود ۱٬۱۰۰٬۰۰۰ تومان در ماه. با openai/gpt-5-mini حدود ۸۸۰٬۰۰۰ تومان. با deepseek/deepseek-chat حدود ۵۴۰٬۰۰۰ تومان. با anthropic/claude-sonnet-4.5 حدود ۷٬۴۰۰٬۰۰۰ تومان. برای پشتیبانی فروشگاهی که کار اصلیاش پیدا کردن وضعیت سفارش و جواب سؤالهای تکراری است، مدل ارزان معمولاً کافی است؛ کیفیت اینجا بیشتر از پرامپت و tool calling میآید تا از مدل.
خلاصهسازی ۵۰۰ سند حقوقی در ماه، هر کدام ۵٬۰۰۰ کلمه. اینجا ورودی سنگین است: حدود ۸٬۹۰۰ توکن ورودی و شاید ۶۰۰ توکن خروجی بهازای هر سند. با google/gemini-2.5-flash هر سند حدود ۵۵۰ تومان و ماهانه حدود ۲۷۵٬۰۰۰ تومان. با openai/gpt-5 هر سند حدود ۲٬۲۶۰ تومان و ماهانه ۱٬۱۳۰٬۰۰۰ تومان. اگر دقت حقوقی حیاتی است، اختلاف ۸۵۰ هزار تومان در ماه احتمالاً ارزشش را دارد؛ اگر خلاصه فقط برای مرور اولیه است، نه.
دستیار کدنویسی برای یک تیم دهنفره، هر نفر ۱۰۰ درخواست در روز. یعنی ۳۰٬۰۰۰ درخواست ماهانه، با ورودی بزرگ (فایل و context) که فرض میکنیم ۴٬۰۰۰ توکن و خروجی ۱٬۰۰۰ توکن باشد. با qwen/qwen3-coder هر درخواست حدود ۲۹۰ تومان و ماهانه حدود ۸٬۷۰۰٬۰۰۰ تومان. با anthropic/claude-sonnet-4.5 هر درخواست حدود ۳٬۵۶۰ تومان و ماهانه حدود ۱۰۷ میلیون تومان. اینجا اختلاف آنقدر بزرگ است که تیمها معمولاً ترکیبی میروند: مدل ارزان برای تکمیل کد و مدل گران برای بازبینی و طراحی.
چیزهایی که در جدول نیست ولی پول میگیرد
قیمتگذاری مدلها فقط دو ستون ورودی و خروجی نیست. اینها را از روی تجربه بدان:
- توکنهای استدلال. مدلهایی مثل
deepseek/deepseek-r1و GPT-5 باreasoning_effortبالا، قبل از جواب «فکر میکنند» و آن توکنها با قیمت خروجی شارژ میشوند. یک سؤال کوتاه میتواند چند هزار توکن استدلال تولید کند. مقدار دقیق درusage.completion_tokens_details.reasoning_tokensپاسخ میآید. - جستجوی وب. بعضی مدلها پارامتر جستجوی وب دارند و هر فراخوانی هزینهٔ ثابت جدا دارد؛ برای GPT-5 این هزینه حدود ۱٬۳۱۹ تومان بهازای هر درخواست است، مستقل از توکنها. در بلوک
pricingهر مدل با کلیدweb_searchمیآید. - تصویر در ورودی. مدلهای چندوجهی تصویر را به توکن تبدیل میکنند یا قیمت ثابت بهازای هر تصویر دارند؛ کلید
imageدرpricingهر مدل را در/v1/modelsببین. - کش پرامپت. اگر ابتدای پرامپتهایت تکراری است (پیام system بلند، چند نمونهٔ ثابت)، ارائهدهندگان بزرگ توکنهای کششده را بسیار ارزانتر حساب میکنند: برای GPT-5 توکن ورودی کششده حدود ۱۶٬۴۸۴ تومان بهازای هر میلیون است بهجای ۱۶۴٬۸۴۴، و برای Claude Sonnet 4.5 حدود ۳۹٬۵۶۳ تومان بهجای ۳۹۵٬۶۲۵. برای OpenAI و Gemini این کش خودکار است؛ برای Anthropic باید
cache_controlرا در پیامها بگذاری. رقم کششده درusage.prompt_tokens_details.cached_tokensگزارش میشود و کلیدinput_cache_readدرpricingقیمتش را میگوید.
سازوکار شارژ: چرا اول بیشتر بلوکه میشود
قبل از اینکه درخواست به مدل برسد، دروازه هزینهٔ آن را برآورد میکند: توکنهای ورودی را با همان توکنایزر میشمارد، برای خروجی max_tokens تو را در نظر میگیرد (اگر نفرستاده باشی، ۴٬۰۹۶)، کمی ضریب احتیاط رویش میگذارد و این مبلغ را از موجودی قابلاستفادهات موقتاً بلوکه میکند. وقتی پاسخ کامل شد، هزینهٔ واقعی از روی مصرف گزارششدهٔ همان درخواست حساب میشود، همان مبلغ کم میشود و بقیهٔ بلوکه آزاد میشود. قیمتی که در لحظهٔ شروع درخواست معتبر بوده، برای کل آن درخواست ثابت میماند؛ تغییر قیمت وسط یک استریم طولانی، آن درخواست را گرانتر نمیکند.
دو پیامد عملی: اگر max_tokens بزرگی روی مدل گرانی بفرستی و موجودی کافی برای برآورد نداشته باشی، 402 میگیری حتی اگر پاسخ واقعی کوچک باشد. و اگر استریم را وسط کار قطع کنی، فقط بابت توکنهایی که واقعاً تولید شده شارژ میشوی. جزئیات کامل در صفحهٔ قیمتگذاری است و هر ردیف تراکنش در داشبورد با شناسهٔ درخواست قابل پیگیری است.
مدلهای رایگان
کاتالوگ فعلی ۱۸ مدل با پسوند :free دارد که برایشان پولی کم نمیشود و بدون شارژ هم قابل استفادهاند. صادقانه: اینها ظرفیت مشترک هستند، سقف روزانهٔ ۵۰ درخواست بهازای هر کاربر دارند، و در ساعتهای شلوغ ممکن است 429 بگیری. برای یادگیری، تست پرامپت و نمونهٔ اولیه عالیاند؛ برای محصولی که کاربر واقعی دارد، رویشان حساب نکن. وقتی سهم رایگان تمام شود، پیام خطا نزدیکترین مدل پولی و قیمت تقریبیاش را پیشنهاد میدهد.
چطور هزینه را پایین بیاوریم
ترتیب اثرگذاری از روی تجربهٔ خودمان و مشتریها:
- مدل را با کار جور کن. دستهبندی، استخراج فیلد و پاسخهای قالبی را به مدلهای ارزان بده و مدل گران را برای جایی نگه دار که استدلال چندمرحلهای لازم است. یک لایهٔ مسیریابی ساده (اگر پیام کوتاه بود مدل ارزان، وگرنه گران) اغلب نصف هزینه را کم میکند.
max_tokensرا واقعی بگذار. هم برآورد بلوکه دقیقتر میشود، هم مدل کمتر پرحرفی میکند.- پیام system را کوتاه و ثابت نگه دار تا از کش پرامپت بهره ببری. هر کلمهٔ اضافه در system در هر درخواست تکرار میشود.
- تاریخچهٔ گفتگو را هرس کن. فرستادن کل تاریخچه در هر پیام، هزینه را با هر رفتوبرگشت بهصورت خطی بالا میبرد. ده پیام آخر یا یک خلاصهٔ فشرده کافی است.
- خروجی ساختیافته بخواه. JSON کوتاه با فیلدهای مشخص، از یک پاراگراف توضیح ارزانتر است و پردازشش هم آسانتر.
- برای هر کلید سقف ماهانه بگذار. این هزینه را کم نمیکند، ولی جلوی فاجعهٔ یک حلقهٔ بینهایت در ساعت سه صبح را میگیرد.
این جدول کِی کهنه میشود
قیمتها به دلایل مختلف تغییر میکنند و ما این مقاله را ماهانه بهروز میکنیم؛ تاریخ بهروزرسانی بالای صفحه است. ولی اگر داری تصمیم مالی میگیری، عدد را از صفحهٔ مدل یا از بلوک pricing در API بخوان، نه از اینجا. اگر میخواهی با کیف پول کوچک امتحان کنی و ببینی درخواست واقعی تو چند تومان میشود، یک حساب بساز، ۵۰ هزار تومان شارژ کن و هدر X-Uttapen-Cost-Toman هر پاسخ را نگاه کن؛ این دقیقترین ماشینحساب است.
مقالههای مرتبط
- دسترسی به API مدلهای OpenAI و Claude از ایران — راهنمای کامل ۱۴۰۵راههای واقعی دسترسی به API مدلهای GPT، Claude و Gemini از ایران، ریسک هر کدام، و راهاندازی در ۱۰ دقیقه با کلید تومانی و SDK رسمی OpenAI.
- مدلهای ارزان ولی خوب: DeepSeek، Qwen و Gemini Flash برای پروژههای پرحجمقیمت تومانی واقعی مدلهای ارزان بهازای یک میلیون توکن، هزینهٔ ۱۰٬۰۰۰ درخواست در دو سناریو، و کدی که هزاران درخواست را با کنترل هزینه اجرا میکند.
- چطور کد OpenAIات را با تغییر یک خط به یوتاپن وصل کنی (Python، Node، PHP)راهنمای عملی تغییر base_url در SDK رسمی OpenAI برای Python، Node.js و PHP، با کد تستشده، خواندن هزینهٔ تومانی از هدر پاسخ و نکات مهاجرت بدون شکستن کد.
با شماره موبایل ثبتنام کن، کیف پول را شارژ کن و کلید بگیر. ساخت کلید API ←