کاهش مصرف توکن؛ هزینه کمتر با خروجی بهتر
کاهش مصرف توکن فقط صرفهجویی در هزینه نیست؛ خروجی را هم بهتر میکند. ببینید توکن چیست، کجا هدر میرود و با چه تغییرهایی میتوانید کنترلش کنید.

کاهش مصرف توکن؛ هزینه کمتر با خروجی بهتر
کاهش مصرف توکن یکی از آن کارهایی است که همه فکر میکنند فقط به پول مربوط است، در حالی که مستقیماً روی کیفیت خروجی هم اثر میگذارد. هرچه اطلاعات نامربوط کمتری به مدل بدهید، جوابش دقیقتر میشود. یعنی صرفهجویی و کیفیت اینجا با هم در تضاد نیستند، همجهتاند. در این مقاله میبینیم توکن دقیقاً چیست، کجا هدر میرود و با چه تغییرهایی میتوانید کنترلش کنید.
توکن چیست و چرا اهمیت دارد
توکن واحد شمارش متن برای مدلهای هوش مصنوعی است. تقریباً هر کلمهی فارسی چند توکن حساب میشود و هر چیزی که میفرستید و هر چیزی که دریافت میکنید، روی این شمارش اثر دارد.
نکتهی مهم این است که مدل در هر درخواست، کل گفتوگو را دوباره میخواند. یعنی وقتی در پیام بیستم هستید، همهی نوزده پیام قبلی هم دوباره پردازش میشوند. به همین دلیل هزینهی یک گفتوگوی طولانی خطی رشد نمیکند، تصاعدی رشد میکند.
اثر دومش روی کیفیت است. وقتی حجم زیادی متن نامربوط جلوی مدل باشد، تمرکزش پخش میشود. مثل این است که از کسی سؤالی بپرسید در حالی که همزمان ده نفر دیگر دارند حرف میزنند. جواب میگیرید، ولی نه بهترین جوابی که آن شخص میتوانست بدهد.
کجا بیشترین اتلاف رخ میدهد
از تجربه، چهار جا بیشترین سهم را دارند.
اول، گفتوگوهای بیپایان. خیلیها یک گفتوگو را باز میکنند و هفتهها ادامه میدهند. تا پیام صدم، هر درخواست ساده هزینهی یک درخواست سنگین را دارد.
دوم، فرستادن کل فایل بهجای بخش مربوطه. وقتی یک فایل هزار خطی میفرستید تا سه خطش را عوض کند، نهصد و نود و هفت خط اضافه فرستادهاید.
سوم، تکرار توضیحها. اگر هر بار مجبورید بگویید پروژه چیست و چه قواعدی دارید، همان متن بارها و بارها پردازش میشود.
چهارم، انتخاب مدل سنگین برای کار سبک. این مورد در کارهای پرتکرار فاجعهبار میشود، چون هزینه ضرب در تعداد اجرا میشود.
کاهش مصرف توکن در پنج قدم عملی
گفتوگوی جدید باز کنید
سادهترین و مؤثرترین کار. وقتی موضوع عوض شد، گفتوگوی تازه شروع کنید. نگهداشتن تاریخچهی نامربوط نه کمکی میکند نه لازم است.
قاعدهی من این است: هر بار که کار جدیدی شروع میشود، پنجرهی جدید. حتی اگر مربوط به همان پروژه باشد.
فایل حافظه بسازید
بهجای اینکه هر بار زمینه را توضیح دهید، یک بار بنویسیدش. این کار هم توکن را کم میکند هم جوابها را یکدستتر. در حافظه برای Claude Code کامل توضیح دادهام چه چیزی باید داخلش باشد.
فقط بخش لازم را بفرستید
قبل از فرستادن، از خودتان بپرسید مدل واقعاً به کدام قسمت نیاز دارد. اگر سؤالتان دربارهی یک بخش مشخص است، فقط همان را بفرستید.
مدل را متناسب با کار انتخاب کنید
برای دستهبندی و جستوجو و کارهای ساده، مدل سبک کافی است. مدل سنگین را برای جایی نگه دارید که واقعاً استدلال لازم است. در کلاد سونت چیست این انتخاب را کامل بررسی کردهام.
درخواست را دقیق بنویسید
پرامپت مبهم یعنی چند بار رفتوبرگشت تا به جواب درست برسید. هر رفتوبرگشت هزینه دارد. یک درخواست دقیق که بار اول جواب میدهد، از سه درخواست مبهم ارزانتر است.
اشتباه رایجی که باید از آن پرهیز کرد
بعضیها برای صرفهجویی، درخواستهایشان را بیش از حد کوتاه میکنند. این نتیجهی معکوس میدهد.
| کار درست | کار اشتباه |
|---|---|
| حذف اطلاعات نامربوط | حذف اطلاعات ضروری |
| گفتوگوی جدید برای موضوع جدید | پاککردن تاریخچهی لازم |
| فرستادن بخش مربوطه | فرستادن نصفه و ناقص |
| درخواست دقیق و روشن | درخواست تلگرافی و مبهم |
تفاوت این دو ستون در یک چیز است: اطلاعات نامربوط را حذف کنید، نه اطلاعات لازم را. پرامپت کوتاه هدف نیست؛ پرامپت بدون اضافات هدف است.
وقتی اطلاعات لازم را حذف میکنید، مدل مجبور میشود حدس بزند. حدس اشتباه یعنی دوباره توضیح دادن و دوباره درخواست دادن. در نهایت بیشتر از آنچه صرفهجویی کردید هزینه میدهید.
این موضوع برای کسبوکار چه معنایی دارد
تا وقتی خودتان کار میکنید، این بحث یک صرفهجویی کوچک است. وقتی اتوماسیون میسازید، تبدیل به یک تصمیم معماری میشود.
یک ورکفلو که روزی هزار بار اجرا میشود، اگر هر اجرایش دو برابر لازم توکن مصرف کند، ماهانه هزینهی چند برابری روی دستتان میگذارد بدون اینکه خروجی بهتری بدهد. و این مشکل معمولاً وقتی دیده میشود که صورتحساب میرسد، نه وقتی سیستم ساخته میشود.
به همین دلیل در طراحی سیستمهای ایجنتیک، بهینهسازی مصرف از همان روز اول جزو معماری است، نه کاری که بعداً انجام شود. همین منطق در XOS برای چیدن ایجنتها استفاده میشود.
اگر میخواهید سیستم فعلیتان بازبینی شود، میتوانید درخواست مشاوره بدهید.
سوالات متداول
کاهش مصرف توکن باعث افت کیفیت میشود؟
نه، معمولاً برعکس. وقتی اطلاعات نامربوط را حذف میکنید، تمرکز مدل بیشتر میشود و جواب دقیقتری میگیرید. افت کیفیت وقتی رخ میدهد که اطلاعات ضروری را حذف کنید، نه اضافی را.
از کجا بفهمم چقدر توکن مصرف میکنم؟
بیشتر ابزارها مصرف را نشان میدهند. ولی برای شروع لازم نیست دقیق اندازه بگیرید؛ همان چهار عادتی که در این مقاله گفته شد، بیشترین اثر را دارند.
آیا فارسی توکن بیشتری مصرف میکند؟
بله، متن فارسی معمولاً نسبت به انگلیسی توکن بیشتری میگیرد. این دلیل نمیشود انگلیسی بنویسید؛ فقط یعنی رعایت این نکتهها برای ما اهمیت بیشتری دارد.
بهترین کار برای شروع چیست؟
باز کردن گفتوگوی جدید برای هر موضوع. سادهترین کار است و بیشترین اثر را دارد، مخصوصاً اگر عادت دارید یک گفتوگو را طولانی نگه دارید.
قدم بعدی
اگر میخواهید این نکتهها را در عمل ببینید، ویدیوی کامل آموزش کلاد را تماشا کنید؛ نزدیک یک ساعت است و روش کار روزمره را قدمبهقدم نشان میدهد.
در فصل دوم دورهی سفر هوش مصنوعی روی مهندسی پرامپت کار میکنیم؛ همان مهارتی که باعث میشود بار اول جواب درست بگیرید و رفتوبرگشت اضافه نداشته باشید.
برای نکتههای کوتاهتر هم کانال یوتیوب را دنبال کنید.
میخواهی اینها را عملی یاد بگیری؟
دورهی سفر هوش مصنوعی: ۷ فصل پروژهمحور از صفر تا درآمد.



نظرها