کاهش مصرف توکن؛ هزینه کمتر با خروجی بهتر

کاهش مصرف توکن فقط صرفه‌جویی در هزینه نیست؛ خروجی را هم بهتر می‌کند. ببینید توکن چیست، کجا هدر می‌رود و با چه تغییرهایی می‌توانید کنترلش کنید.

✍️ عرفان فرنود۵ دقیقه مطالعه
کاور مقاله کاهش مصرف توکن؛ هزینه کمتر با خروجی بهتر

کاهش مصرف توکن؛ هزینه کمتر با خروجی بهتر

کاهش مصرف توکن یکی از آن کارهایی است که همه فکر می‌کنند فقط به پول مربوط است، در حالی که مستقیماً روی کیفیت خروجی هم اثر می‌گذارد. هرچه اطلاعات نامربوط کمتری به مدل بدهید، جوابش دقیق‌تر می‌شود. یعنی صرفه‌جویی و کیفیت اینجا با هم در تضاد نیستند، هم‌جهت‌اند. در این مقاله می‌بینیم توکن دقیقاً چیست، کجا هدر می‌رود و با چه تغییرهایی می‌توانید کنترلش کنید.

توکن چیست و چرا اهمیت دارد

توکن واحد شمارش متن برای مدل‌های هوش مصنوعی است. تقریباً هر کلمه‌ی فارسی چند توکن حساب می‌شود و هر چیزی که می‌فرستید و هر چیزی که دریافت می‌کنید، روی این شمارش اثر دارد.

نکته‌ی مهم این است که مدل در هر درخواست، کل گفت‌وگو را دوباره می‌خواند. یعنی وقتی در پیام بیستم هستید، همه‌ی نوزده پیام قبلی هم دوباره پردازش می‌شوند. به همین دلیل هزینه‌ی یک گفت‌وگوی طولانی خطی رشد نمی‌کند، تصاعدی رشد می‌کند.

اثر دومش روی کیفیت است. وقتی حجم زیادی متن نامربوط جلوی مدل باشد، تمرکزش پخش می‌شود. مثل این است که از کسی سؤالی بپرسید در حالی که همزمان ده نفر دیگر دارند حرف می‌زنند. جواب می‌گیرید، ولی نه بهترین جوابی که آن شخص می‌توانست بدهد.

کجا بیشترین اتلاف رخ می‌دهد

از تجربه، چهار جا بیشترین سهم را دارند.

اول، گفت‌وگوهای بی‌پایان. خیلی‌ها یک گفت‌وگو را باز می‌کنند و هفته‌ها ادامه می‌دهند. تا پیام صدم، هر درخواست ساده هزینه‌ی یک درخواست سنگین را دارد.

دوم، فرستادن کل فایل به‌جای بخش مربوطه. وقتی یک فایل هزار خطی می‌فرستید تا سه خطش را عوض کند، نهصد و نود و هفت خط اضافه فرستاده‌اید.

سوم، تکرار توضیح‌ها. اگر هر بار مجبورید بگویید پروژه چیست و چه قواعدی دارید، همان متن بارها و بارها پردازش می‌شود.

چهارم، انتخاب مدل سنگین برای کار سبک. این مورد در کارهای پرتکرار فاجعه‌بار می‌شود، چون هزینه ضرب در تعداد اجرا می‌شود.

کاهش مصرف توکن در پنج قدم عملی

گفت‌وگوی جدید باز کنید

ساده‌ترین و مؤثرترین کار. وقتی موضوع عوض شد، گفت‌وگوی تازه شروع کنید. نگه‌داشتن تاریخچه‌ی نامربوط نه کمکی می‌کند نه لازم است.

قاعده‌ی من این است: هر بار که کار جدیدی شروع می‌شود، پنجره‌ی جدید. حتی اگر مربوط به همان پروژه باشد.

فایل حافظه بسازید

به‌جای اینکه هر بار زمینه را توضیح دهید، یک بار بنویسیدش. این کار هم توکن را کم می‌کند هم جواب‌ها را یکدست‌تر. در حافظه برای Claude Code کامل توضیح داده‌ام چه چیزی باید داخلش باشد.

فقط بخش لازم را بفرستید

قبل از فرستادن، از خودتان بپرسید مدل واقعاً به کدام قسمت نیاز دارد. اگر سؤالتان درباره‌ی یک بخش مشخص است، فقط همان را بفرستید.

مدل را متناسب با کار انتخاب کنید

برای دسته‌بندی و جست‌وجو و کارهای ساده، مدل سبک کافی است. مدل سنگین را برای جایی نگه دارید که واقعاً استدلال لازم است. در کلاد سونت چیست این انتخاب را کامل بررسی کرده‌ام.

درخواست را دقیق بنویسید

پرامپت مبهم یعنی چند بار رفت‌وبرگشت تا به جواب درست برسید. هر رفت‌وبرگشت هزینه دارد. یک درخواست دقیق که بار اول جواب می‌دهد، از سه درخواست مبهم ارزان‌تر است.

اشتباه رایجی که باید از آن پرهیز کرد

بعضی‌ها برای صرفه‌جویی، درخواست‌هایشان را بیش از حد کوتاه می‌کنند. این نتیجه‌ی معکوس می‌دهد.

کار درستکار اشتباه
حذف اطلاعات نامربوطحذف اطلاعات ضروری
گفت‌وگوی جدید برای موضوع جدیدپاک‌کردن تاریخچه‌ی لازم
فرستادن بخش مربوطهفرستادن نصفه و ناقص
درخواست دقیق و روشندرخواست تلگرافی و مبهم

تفاوت این دو ستون در یک چیز است: اطلاعات نامربوط را حذف کنید، نه اطلاعات لازم را. پرامپت کوتاه هدف نیست؛ پرامپت بدون اضافات هدف است.

وقتی اطلاعات لازم را حذف می‌کنید، مدل مجبور می‌شود حدس بزند. حدس اشتباه یعنی دوباره توضیح دادن و دوباره درخواست دادن. در نهایت بیشتر از آنچه صرفه‌جویی کردید هزینه می‌دهید.

این موضوع برای کسب‌وکار چه معنایی دارد

تا وقتی خودتان کار می‌کنید، این بحث یک صرفه‌جویی کوچک است. وقتی اتوماسیون می‌سازید، تبدیل به یک تصمیم معماری می‌شود.

یک ورک‌فلو که روزی هزار بار اجرا می‌شود، اگر هر اجرایش دو برابر لازم توکن مصرف کند، ماهانه هزینه‌ی چند برابری روی دستتان می‌گذارد بدون اینکه خروجی بهتری بدهد. و این مشکل معمولاً وقتی دیده می‌شود که صورتحساب می‌رسد، نه وقتی سیستم ساخته می‌شود.

به همین دلیل در طراحی سیستم‌های ایجنتیک، بهینه‌سازی مصرف از همان روز اول جزو معماری است، نه کاری که بعداً انجام شود. همین منطق در XOS برای چیدن ایجنت‌ها استفاده می‌شود.

اگر می‌خواهید سیستم فعلی‌تان بازبینی شود، می‌توانید درخواست مشاوره بدهید.

سوالات متداول

کاهش مصرف توکن باعث افت کیفیت می‌شود؟

نه، معمولاً برعکس. وقتی اطلاعات نامربوط را حذف می‌کنید، تمرکز مدل بیشتر می‌شود و جواب دقیق‌تری می‌گیرید. افت کیفیت وقتی رخ می‌دهد که اطلاعات ضروری را حذف کنید، نه اضافی را.

از کجا بفهمم چقدر توکن مصرف می‌کنم؟

بیشتر ابزارها مصرف را نشان می‌دهند. ولی برای شروع لازم نیست دقیق اندازه بگیرید؛ همان چهار عادتی که در این مقاله گفته شد، بیشترین اثر را دارند.

آیا فارسی توکن بیشتری مصرف می‌کند؟

بله، متن فارسی معمولاً نسبت به انگلیسی توکن بیشتری می‌گیرد. این دلیل نمی‌شود انگلیسی بنویسید؛ فقط یعنی رعایت این نکته‌ها برای ما اهمیت بیشتری دارد.

بهترین کار برای شروع چیست؟

باز کردن گفت‌وگوی جدید برای هر موضوع. ساده‌ترین کار است و بیشترین اثر را دارد، مخصوصاً اگر عادت دارید یک گفت‌وگو را طولانی نگه دارید.

قدم بعدی

اگر می‌خواهید این نکته‌ها را در عمل ببینید، ویدیوی کامل آموزش کلاد را تماشا کنید؛ نزدیک یک ساعت است و روش کار روزمره را قدم‌به‌قدم نشان می‌دهد.

در فصل دوم دوره‌ی سفر هوش مصنوعی روی مهندسی پرامپت کار می‌کنیم؛ همان مهارتی که باعث می‌شود بار اول جواب درست بگیرید و رفت‌وبرگشت اضافه نداشته باشید.

برای نکته‌های کوتاه‌تر هم کانال یوتیوب را دنبال کنید.

می‌خواهی این‌ها را عملی یاد بگیری؟

دوره‌ی سفر هوش مصنوعی: ۷ فصل پروژه‌محور از صفر تا درآمد.

نظرها

  • اولین نفری باش که نظر می‌دهد.

مقالات مرتبط