uttapen

قیمت API مدل‌های هوش مصنوعی به تومان — مقایسهٔ GPT-5، Claude، Gemini، DeepSeek

جدول قیمت ۱۷ مدل به تومان به‌ازای هر یک میلیون توکن ورودی و خروجی، هزینهٔ واقعی یک درخواست فارسی، سه سناریوی ماهانه و راه‌های عملی کم‌کردن هزینه.

۱۶ شهریور ۱۴۰۵ · ۱۰ دقیقه مطالعه · تیم یوتاپن

وقتی قیمت مدل‌ها را به‌ازای «یک میلیون توکن» می‌بینی، تصور اینکه اپلیکیشن تو ماهانه چقدر خرج می‌کند سخت است. این مقاله قیمت تومانی مدل‌های پرکاربرد را کنار هم می‌گذارد، با یک درخواست فارسی واقعی حساب می‌کند که هر مدل چند تومان می‌گیرد، و بعد سه محصول فرضی را تا رقم ماهانه جلو می‌برد. اعداد این مقاله در تاریخ ۱۶ شهریور ۱۴۰۵ از کاتالوگ زندهٔ ما برداشته شده و به‌طور منظم به‌روز می‌شود؛ قیمت لحظه‌ای هر مدل همیشه در صفحهٔ همان مدل (مثلاً GPT-5) و از طریق GET /v1/models در دسترس است و همان مرجع نهایی است، نه این جدول.

واحدها را درست بخوان

هر مدل دو قیمت دارد: یکی برای توکن‌های ورودی (هر چیزی که تو می‌فرستی: پیام system، سؤال کاربر، تاریخچهٔ گفتگو، محتوای فایل) و یکی برای توکن‌های خروجی (هر چیزی که مدل تولید می‌کند، از جمله توکن‌های استدلال در مدل‌های reasoning). قیمت‌ها به‌ازای یک میلیون توکن اعلام می‌شود چون عدد یک توکن آن‌قدر کوچک است که خواندنی نیست؛ ولی صورت‌حساب واقعی تو به‌ازای همان چند صد توکنِ هر درخواست محاسبه می‌شود، با دقت تا کسر تومان.

در پاسخ GET /v1/models/openai/gpt-5 بلوک pricing را می‌بینی که همهٔ اجزای قیمت را به تومان به‌ازای هر توکن می‌دهد و فیلد pricing_currency با مقدار IRT تأکید می‌کند که واحد تومان است. برای رسیدن به عدد «هر یک میلیون» کافی است در یک میلیون ضرب کنی. هر پاسخ غیراستریم هم هدر X-Uttapen-Cost-Toman دارد که هزینهٔ همان درخواست را دقیق می‌گوید؛ این هدر بهترین ماشین‌حساب است.

جدول قیمت به تومان

ستون آخر هزینهٔ یک درخواست معمولی فارسی است: حدود ۱٬۰۰۰ کلمه ورودی (پیام system به‌اضافهٔ سؤال کاربر و کمی تاریخچه) که با توکنایزر o200k_base تقریباً ۱٬۷۸۰ توکن می‌شود، و ۵۰۰ کلمه پاسخ که حدود ۸۹۰ توکن است. چرا فارسی این‌قدر توکن می‌خورد را در مقالهٔ توکن با اعداد واقعی نشان داده‌ایم.

مدلورودی (تومان / ۱M توکن)خروجی (تومان / ۱M توکن)هر ۱٬۰۰۰ کلمهٔ فارسی ≈
openai/gpt-5۱۶۴٬۸۴۴۱٬۳۱۸٬۷۵۰۱٬۴۶۷ تومان
openai/gpt-5-mini۳۲٬۹۶۹۲۶۳٬۷۵۰۲۹۳ تومان
openai/gpt-5-nano۶٬۵۹۴۵۲٬۷۵۰۵۹ تومان
openai/gpt-4.1۲۶۳٬۷۵۰۱٬۰۵۵٬۰۰۰۱٬۴۰۸ تومان
openai/gpt-4o-mini۱۹٬۷۸۱۷۹٬۱۲۵۱۰۶ تومان
anthropic/claude-opus-4.1۱٬۹۷۸٬۱۲۵۹٬۸۹۰٬۶۲۵۱۲٬۳۲۴ تومان
anthropic/claude-sonnet-4.5۳۹۵٬۶۲۵۱٬۹۷۸٬۱۲۵۲٬۴۶۵ تومان
anthropic/claude-haiku-4.5۱۳۱٬۸۷۵۶۵۹٬۳۷۵۸۲۲ تومان
google/gemini-2.5-pro۱۶۴٬۸۴۴۱٬۳۱۸٬۷۵۰۱٬۴۶۷ تومان
google/gemini-2.5-flash۳۹٬۵۶۳۳۲۹٬۶۸۸۳۶۴ تومان
google/gemini-2.5-flash-lite۱۳٬۱۸۸۵۲٬۷۵۰۷۰ تومان
deepseek/deepseek-chat-v3.1۷۲٬۵۳۱۲۱۷٬۵۹۴۳۲۳ تومان
deepseek/deepseek-chat۴۲٬۲۰۰۱۱۷٬۳۶۹۱۸۰ تومان
deepseek/deepseek-r1۹۲٬۳۱۳۳۲۹٬۶۸۸۴۵۸ تومان
qwen/qwen3-coder۳۹٬۵۶۳۱۳۱٬۸۷۵۱۸۸ تومان
moonshotai/kimi-k2۷۵٬۱۶۹۳۰۳٬۳۱۳۴۰۴ تومان
meta-llama/llama-3.3-70b-instruct۱۳٬۱۸۸۴۲٬۲۰۰۶۱ تومان

قیمت‌ها به‌طور منظم به‌روز می‌شوند؛ عدد زنده همیشه روی صفحهٔ هر مدل است.

چند چیز از همین جدول بیرون می‌زند. اول اینکه فاصلهٔ ارزان‌ترین و گران‌ترین مدل بیش از دویست برابر است؛ انتخاب مدل مهم‌ترین تصمیم مالی محصول توست، مهم‌تر از هر بهینه‌سازی پرامپت. دوم اینکه توکن خروجی همیشه چند برابر ورودی قیمت دارد (برای GPT-5 هشت برابر، برای Claude پنج برابر)؛ پس پاسخ‌های بی‌دلیل بلند بیشتر از پرامپت‌های بلند خرج دارند. سوم اینکه GPT-5 و Gemini 2.5 Pro دقیقاً یک قیمت دارند و DeepSeek V3 با یک‌هشتم قیمت GPT-5 mini، برای بسیاری از کارهای ساده به‌اندازهٔ کافی خوب است.

رتبه‌بندی از ارزان به گران، برای همان درخواست فارسی

اگر فقط عدد ستون آخر را مرتب کنی، سه دستهٔ طبیعی می‌بینی:

  • زیر ۱۰۰ تومان: GPT-5 nano، Llama 3.3 70B، Gemini 2.5 Flash Lite. برای دسته‌بندی، استخراج فیلد، تشخیص زبان، پاسخ‌های قالبی و هر جایی که حجم زیاد و پیچیدگی کم است.
  • ۱۰۰ تا ۵۰۰ تومان: GPT-4o mini، DeepSeek V3، Qwen3 Coder، GPT-5 mini، DeepSeek V3.1، Gemini 2.5 Flash، Kimi K2، DeepSeek R1. اینجا بیشترین محصول‌های واقعی زندگی می‌کنند: چت پشتیبانی، تولید محتوای پیش‌نویس، خلاصه‌سازی، کدنویسی روزمره.
  • بالای ۸۰۰ تومان: Claude Haiku 4.5، GPT-4.1، GPT-5، Gemini 2.5 Pro، Claude Sonnet 4.5، و در انتها Claude Opus 4.1 با اختلاف زیاد. برای استدلال چندمرحله‌ای، بازبینی کد، متن‌های حساس و جایی که یک خطا از صد درخواست گران‌تر است.

نکتهٔ مهم: این رتبه‌بندی برای الگوی «ورودی دو برابر خروجی» است. اگر کارت خلاصه‌سازی است (ورودی خیلی بزرگ، خروجی کوچک)، مدل‌هایی که ورودی ارزان دارند جلو می‌افتند؛ اگر تولید متن بلند است، قیمت خروجی تعیین‌کننده می‌شود و فاصله‌ها بیشتر باز می‌شود.

هزینه در مقیاس: سه سناریوی واقعی

عدد یک درخواست به تنهایی معنا ندارد؛ بگذار سه محصول فرضی را حساب کنیم. در هر سه، همان درخواست ۱٬۰۰۰ کلمه‌ای بالا مبنای محاسبه است مگر اینکه خلافش گفته شود.

پشتیبانی هوشمند یک فروشگاه با ۳٬۰۰۰ گفتگو در ماه. با google/gemini-2.5-flash می‌شود حدود ۱٬۱۰۰٬۰۰۰ تومان در ماه. با openai/gpt-5-mini حدود ۸۸۰٬۰۰۰ تومان. با deepseek/deepseek-chat حدود ۵۴۰٬۰۰۰ تومان. با anthropic/claude-sonnet-4.5 حدود ۷٬۴۰۰٬۰۰۰ تومان. برای پشتیبانی فروشگاهی که کار اصلی‌اش پیدا کردن وضعیت سفارش و جواب سؤال‌های تکراری است، مدل ارزان معمولاً کافی است؛ کیفیت اینجا بیشتر از پرامپت و tool calling می‌آید تا از مدل.

خلاصه‌سازی ۵۰۰ سند حقوقی در ماه، هر کدام ۵٬۰۰۰ کلمه. اینجا ورودی سنگین است: حدود ۸٬۹۰۰ توکن ورودی و شاید ۶۰۰ توکن خروجی به‌ازای هر سند. با google/gemini-2.5-flash هر سند حدود ۵۵۰ تومان و ماهانه حدود ۲۷۵٬۰۰۰ تومان. با openai/gpt-5 هر سند حدود ۲٬۲۶۰ تومان و ماهانه ۱٬۱۳۰٬۰۰۰ تومان. اگر دقت حقوقی حیاتی است، اختلاف ۸۵۰ هزار تومان در ماه احتمالاً ارزشش را دارد؛ اگر خلاصه فقط برای مرور اولیه است، نه.

دستیار کدنویسی برای یک تیم ده‌نفره، هر نفر ۱۰۰ درخواست در روز. یعنی ۳۰٬۰۰۰ درخواست ماهانه، با ورودی بزرگ (فایل و context) که فرض می‌کنیم ۴٬۰۰۰ توکن و خروجی ۱٬۰۰۰ توکن باشد. با qwen/qwen3-coder هر درخواست حدود ۲۹۰ تومان و ماهانه حدود ۸٬۷۰۰٬۰۰۰ تومان. با anthropic/claude-sonnet-4.5 هر درخواست حدود ۳٬۵۶۰ تومان و ماهانه حدود ۱۰۷ میلیون تومان. اینجا اختلاف آن‌قدر بزرگ است که تیم‌ها معمولاً ترکیبی می‌روند: مدل ارزان برای تکمیل کد و مدل گران برای بازبینی و طراحی.

چیزهایی که در جدول نیست ولی پول می‌گیرد

قیمت‌گذاری مدل‌ها فقط دو ستون ورودی و خروجی نیست. این‌ها را از روی تجربه بدان:

  • توکن‌های استدلال. مدل‌هایی مثل deepseek/deepseek-r1 و GPT-5 با reasoning_effort بالا، قبل از جواب «فکر می‌کنند» و آن توکن‌ها با قیمت خروجی شارژ می‌شوند. یک سؤال کوتاه می‌تواند چند هزار توکن استدلال تولید کند. مقدار دقیق در usage.completion_tokens_details.reasoning_tokens پاسخ می‌آید.
  • جستجوی وب. بعضی مدل‌ها پارامتر جستجوی وب دارند و هر فراخوانی هزینهٔ ثابت جدا دارد؛ برای GPT-5 این هزینه حدود ۱٬۳۱۹ تومان به‌ازای هر درخواست است، مستقل از توکن‌ها. در بلوک pricing هر مدل با کلید web_search می‌آید.
  • تصویر در ورودی. مدل‌های چندوجهی تصویر را به توکن تبدیل می‌کنند یا قیمت ثابت به‌ازای هر تصویر دارند؛ کلید image در pricing هر مدل را در /v1/models ببین.
  • کش پرامپت. اگر ابتدای پرامپت‌هایت تکراری است (پیام system بلند، چند نمونهٔ ثابت)، ارائه‌دهندگان بزرگ توکن‌های کش‌شده را بسیار ارزان‌تر حساب می‌کنند: برای GPT-5 توکن ورودی کش‌شده حدود ۱۶٬۴۸۴ تومان به‌ازای هر میلیون است به‌جای ۱۶۴٬۸۴۴، و برای Claude Sonnet 4.5 حدود ۳۹٬۵۶۳ تومان به‌جای ۳۹۵٬۶۲۵. برای OpenAI و Gemini این کش خودکار است؛ برای Anthropic باید cache_control را در پیام‌ها بگذاری. رقم کش‌شده در usage.prompt_tokens_details.cached_tokens گزارش می‌شود و کلید input_cache_read در pricing قیمتش را می‌گوید.

سازوکار شارژ: چرا اول بیشتر بلوکه می‌شود

قبل از اینکه درخواست به مدل برسد، دروازه هزینهٔ آن را برآورد می‌کند: توکن‌های ورودی را با همان توکنایزر می‌شمارد، برای خروجی max_tokens تو را در نظر می‌گیرد (اگر نفرستاده باشی، ۴٬۰۹۶)، کمی ضریب احتیاط رویش می‌گذارد و این مبلغ را از موجودی قابل‌استفاده‌ات موقتاً بلوکه می‌کند. وقتی پاسخ کامل شد، هزینهٔ واقعی از روی مصرف گزارش‌شدهٔ همان درخواست حساب می‌شود، همان مبلغ کم می‌شود و بقیهٔ بلوکه آزاد می‌شود. قیمتی که در لحظهٔ شروع درخواست معتبر بوده، برای کل آن درخواست ثابت می‌ماند؛ تغییر قیمت وسط یک استریم طولانی، آن درخواست را گران‌تر نمی‌کند.

دو پیامد عملی: اگر max_tokens بزرگی روی مدل گرانی بفرستی و موجودی کافی برای برآورد نداشته باشی، 402 می‌گیری حتی اگر پاسخ واقعی کوچک باشد. و اگر استریم را وسط کار قطع کنی، فقط بابت توکن‌هایی که واقعاً تولید شده شارژ می‌شوی. جزئیات کامل در صفحهٔ قیمت‌گذاری است و هر ردیف تراکنش در داشبورد با شناسهٔ درخواست قابل پیگیری است.

مدل‌های رایگان

کاتالوگ فعلی ۱۸ مدل با پسوند :free دارد که برایشان پولی کم نمی‌شود و بدون شارژ هم قابل استفاده‌اند. صادقانه: این‌ها ظرفیت مشترک هستند، سقف روزانهٔ ۵۰ درخواست به‌ازای هر کاربر دارند، و در ساعت‌های شلوغ ممکن است 429 بگیری. برای یادگیری، تست پرامپت و نمونهٔ اولیه عالی‌اند؛ برای محصولی که کاربر واقعی دارد، روی‌شان حساب نکن. وقتی سهم رایگان تمام شود، پیام خطا نزدیک‌ترین مدل پولی و قیمت تقریبی‌اش را پیشنهاد می‌دهد.

چطور هزینه را پایین بیاوریم

ترتیب اثرگذاری از روی تجربهٔ خودمان و مشتری‌ها:

  1. مدل را با کار جور کن. دسته‌بندی، استخراج فیلد و پاسخ‌های قالبی را به مدل‌های ارزان بده و مدل گران را برای جایی نگه دار که استدلال چندمرحله‌ای لازم است. یک لایهٔ مسیریابی ساده (اگر پیام کوتاه بود مدل ارزان، وگرنه گران) اغلب نصف هزینه را کم می‌کند.
  2. max_tokens را واقعی بگذار. هم برآورد بلوکه دقیق‌تر می‌شود، هم مدل کمتر پرحرفی می‌کند.
  3. پیام system را کوتاه و ثابت نگه دار تا از کش پرامپت بهره ببری. هر کلمهٔ اضافه در system در هر درخواست تکرار می‌شود.
  4. تاریخچهٔ گفتگو را هرس کن. فرستادن کل تاریخچه در هر پیام، هزینه را با هر رفت‌وبرگشت به‌صورت خطی بالا می‌برد. ده پیام آخر یا یک خلاصهٔ فشرده کافی است.
  5. خروجی ساخت‌یافته بخواه. JSON کوتاه با فیلدهای مشخص، از یک پاراگراف توضیح ارزان‌تر است و پردازشش هم آسان‌تر.
  6. برای هر کلید سقف ماهانه بگذار. این هزینه را کم نمی‌کند، ولی جلوی فاجعهٔ یک حلقهٔ بی‌نهایت در ساعت سه صبح را می‌گیرد.

این جدول کِی کهنه می‌شود

قیمت‌ها به دلایل مختلف تغییر می‌کنند و ما این مقاله را ماهانه به‌روز می‌کنیم؛ تاریخ به‌روزرسانی بالای صفحه است. ولی اگر داری تصمیم مالی می‌گیری، عدد را از صفحهٔ مدل یا از بلوک pricing در API بخوان، نه از اینجا. اگر می‌خواهی با کیف پول کوچک امتحان کنی و ببینی درخواست واقعی تو چند تومان می‌شود، یک حساب بساز، ۵۰ هزار تومان شارژ کن و هدر X-Uttapen-Cost-Toman هر پاسخ را نگاه کن؛ این دقیق‌ترین ماشین‌حساب است.

مقاله‌های مرتبط

می‌خواهی همین کد را اجرا کنی؟

با شماره موبایل ثبت‌نام کن، کیف پول را شارژ کن و کلید بگیر. ساخت کلید API ←