مقالات محصولات نمونه‌کارها درباره ما ورود به حساب درخواست مشاوره
MODIRAM / JOURNAL

Sonnet 5.5 معرفی شد؛ «هوش مصنوعی ارزان‌تر» دقیقاً یعنی چه؟

معرفی Sonnet 5.5 بهانه‌ای برای فهم تفاوت قیمت توکن و هزینه انجام کار است؛ با تفکیک ادعای سازنده، آزمون مستقل و نقش تنظیم تلاش مدل.

تاریخ انتشار1405/07/09 14:34 زمان مطالعه7 دقیقه
Sonnet 5.5 معرفی شد؛ «هوش مصنوعی ارزان‌تر» دقیقاً یعنی چه؟
MODIRAM EDITORIALهوش مصنوعی

آنتروپیک در ۲۸ سپتامبر ۲۰۲۶ مدل Claude Sonnet 5.5 را معرفی کرد و گفت این نسخه در آزمون‌های خودش برای بسیاری از کارها تا ۳۰ درصد هزینه کمتری از Sonnet 5 داشته است. بااین‌حال، قیمت پایه هر توکن این دو نسخه یکسان اعلام شده است. این دو جمله چگونه می‌توانند هم‌زمان درست باشند؟ پاسخ، تفاوت میان نرخ مصرف و مقدار مصرف است؛ تفاوتی که برای فهم خبرهای مدل‌های هوش مصنوعی، حتی بدون دانش برنامه‌نویسی، اهمیت دارد. این مقاله در ۱ اکتبر ۲۰۲۶ منابع را بررسی کرده و تاریخ معرفی مدل را با تاریخ بررسی خبر یکی نمی‌گیرد. منبع معرفی: آنتروپیک

عبارت «ارزان‌تر» بدون مشخص کردن واحد مقایسه ناقص است. ممکن است درباره قیمت پردازش مقدار معینی متن صحبت کنیم، یا درباره مبلغ لازم برای تمام کردن یک درخواست. در ارزیابی یک دستیار، نتیجه قابل استفاده هم مهم است: پاسخ کم‌هزینه‌ای که نیاز به چند بار اصلاح دارد، تجربه متفاوتی از پاسخی دارد که همان بار اول معیارهای کار را برآورده می‌کند. پرسش این گزارش این است که از خبر تازه چه می‌دانیم و برای نتیجه‌گیری درباره استفاده خودمان، چه چیزهایی را هنوز باید بسنجیم.

خبر عرضه، چه چیزی را ثابت می‌کند؟

سازنده Sonnet 5.5 را برای کارهای روزمره با دامنه روشن، رفع اشکال و تهیه سند، اسلاید و صفحه‌گسترده معرفی می‌کند. ادعای کاهش هزینه، نتیجه آزمایش‌های خود شرکت است؛ نه تضمین برای هر درخواست و هر کاربر. بنابراین خبر عرضه را باید از داوری درباره صرفه اقتصادی جدا نگه داشت. معرفی یک محصول نشان می‌دهد شرکت چه چیزی عرضه کرده و درباره آن چه می‌گوید؛ اثبات اینکه همان مزیت در کار ما هم رخ می‌دهد، به شواهد دیگری نیاز دارد. توضیح رسمی کاربردها و حدود ادعای هزینه

واحد کوچک متن، صورتحساب بزرگ‌تر

توکن واحدی است که سامانه برای پردازش متن به کار می‌برد و لزوماً با یک واژه برابر نیست. در جدول رسمی قیمت‌گذاری، نرخ پایه Sonnet 5.5 برابر ۲ دلار برای هر یک میلیون توکن ورودی و ۱۰ دلار برای هر یک میلیون توکن خروجی درج شده است. این اعداد مربوط به رابط برنامه‌نویسی، یعنی اتصال نرم‌افزارها به مدل، هستند؛ نباید آنها را قیمت یک اشتراک ماهانه یا مبلغ هر گفتگوی معمولی معرفی کرد.

همان مستند، برای استفاده دوباره از ورودی ذخیره‌شده نرخ جداگانه‌ای دارد. به زبان ساده، وقتی بخشی از متن قبلاً پردازش و در حافظه موقت نگهداری شده باشد، خواندن دوباره آن می‌تواند با نرخ متفاوتی حساب شود. پس حتی دو درخواست با طول ظاهراً یکسان، بدون دانستن ترکیب ورودی، خروجی و استفاده از حافظه موقت، مقایسه کاملی ندارند. جدول قیمت نقطه شروع محاسبه است؛ مقدار واقعی مصرف تعیین می‌کند حاصل ضرب نهایی چقدر شود.

آزمون مستقل، با نام کامل تنظیمات

در زمان بررسی این گزارش، صفحه ارزیابی Artificial Analysis برای Sonnet 5.5 با استدلال تطبیقی، سطح تلاش Max و fallback پیش‌فرض، هزینه متوسط ۷٫۶۲ دلار به‌ازای هر وظیفه در شاخص هوش خود نشان می‌داد. fallback یعنی امکان بازگشت سامانه به مدل جایگزین طبق تنظیمات سرویس. عدد بالا برای همان مجموعه آزمون و همان پیکربندی است؛ قیمت یک پیام کوتاه، خلاصه‌سازی روزانه یا همه کارهای مردم نیست.

این ارزیاب هزینه هر وظیفه را با در نظر گرفتن توکن‌های ورودی، خروجی، استدلال و حافظه موقت و وزن آزمون‌ها محاسبه می‌کند. در نتیجه، عدد آن با یک ادعای کلی درباره کاهش هزینه نسبت به نسل قبل، بدون یکسان کردن شرایط قابل مقایسه مستقیم نیست. اینجا شاهدی مستقل از سازنده داریم، اما استقلال منبع به معنای پوشش همه کاربردها نیست. به‌ویژه از همین عدد نمی‌توان درباره کیفیت نوشتن فارسی یا میزان اصلاح لازم برای یک سند مشخص حکم داد.

دکمه «تلاش بیشتر» چه چیزی را تغییر می‌دهد؟

در راهنمای رسمی سطح تلاش، effort به میزان منابعی مربوط است که مدل برای انجام درخواست صرف می‌کند. این تنظیم، انتخاب مدل را عوض نمی‌کند؛ به همان مدل علامت می‌دهد چقدر کار و بررسی انجام دهد. سطح بالاتر می‌تواند به مصرف توکن و زمان بیشتر منجر شود. سطح پایین‌تر هم ممکن است برای یک مسئله پیچیده کافی نباشد و کار را ناتمام بگذارد. بنابراین بیشترین مقدار، پاسخ خودکار به همه نیازها نیست.

راهنمای سازنده پیشنهاد می‌کند از تنظیم پیش‌فرض شروع شود و تغییر، متناسب با نتیجه مشاهده‌شده باشد. برداشت کاربردی ما این است که نام مدل و سطح تلاش باید کنار هم ثبت شوند؛ مقایسه دو خروجی وقتی یکی با تنظیم سبک و دیگری با تنظیم سنگین تولید شده، فقط مقایسه نام دو مدل نیست. این یک روش پیشنهادی برای منصفانه‌تر کردن مشاهده است، نه ادعای اینکه سطح خاصی برای همه کاربران بهترین خواهد بود.

نکته کمتر قابل مشاهده در راهنمای مهاجرت Sonnet 5.5 آمده است: توکن‌های مرحله استدلال در صورتحساب خروجی حساب می‌شوند، حتی وقتی متن آن مرحله به‌طور پیش‌فرض نمایش داده نمی‌شود. در نتیجه، کوتاه بودن پاسخ نهایی به‌تنهایی نشان‌دهنده کم بودن کل مصرف نیست. این نکته برای سازندگان برنامه‌ها مهم است؛ کسی که فقط چند خط نتیجه را می‌بیند، الزاماً همه پردازش انجام‌شده پشت آن نتیجه را نمی‌بیند.

یک نمونه فرضی: خلاصه‌ای که واقعاً آماده ارسال باشد

برای ملموس شدن بحث، یک سناریوی کاملاً فرضی را در نظر بگیرید. فردی می‌خواهد یادداشت‌های یک سفر گروهی را به برنامه‌ای کوتاه تبدیل کند. پیش از استفاده از دستیار، سه شرط می‌نویسد: ساعت‌ها از متن اصلی تغییر نکنند، برنامه پیشنهادی از رزرو قطعی جدا باشد و اطلاعات ناموجود ساخته نشود. این مثال، گزارش آزمایش Sonnet یا تجربه واقعی یک کاربر نیست؛ روشی برای تعریف «کار تمام‌شده» است.

اکنون فرض کنید دو خروجی ظاهر مرتب و متن روانی دارند. در یکی، دستیار یک ساعت حرکت ناموجود اضافه کرده است؛ در دیگری، همان مورد با عبارت «هنوز مشخص نشده» باقی مانده است. اگر فقط سرعت ظاهر شدن متن را ثبت کنیم، تفاوت اصلی گم می‌شود. معیار پیشنهادی در این مثال، زمان رسیدن به برنامه قابل ارسال است؛ از اولین درخواست تا پایان تطبیق ساعت‌ها و اصلاح اطلاعات. ممکن است خروجی سریع‌تر، بازبینی بیشتری بخواهد یا برعکس؛ نتیجه از پیش معلوم نیست.

برای چنین مقایسه‌ای می‌توان همان یادداشت‌ها و همان دستور را در چند اجرای جدا به کار برد و نام نسخه، تنظیم تلاش، موارد خطا و زمان بازبینی را کنار نتیجه نوشت. اگر هزینه مصرف در دسترس باشد، آن هم ثبت می‌شود. این پیشنهاد تحریریه برای یک آزمون شخصی محدود است. چند نمونه کوچک، برتری عمومی یک مدل را اثبات نمی‌کند، ولی روشن می‌کند کدام بخش کار خودمان هنوز به اصلاح نیاز دارد. هیچ نتیجه عددی برای این سناریو اندازه‌گیری نشده است.

خبر Sonnet 5.5 فرصتی است برای دقیق‌تر خواندن واژه «ارزان‌تر». تا وقتی نوع کار، تنظیمات و معیار قبول نتیجه مشخص نباشند، یک نرخ یا درصد به‌تنهایی پاسخ کافی نمی‌دهد. مشاهده تعیین‌کننده برای کاربرِ مثال ما، همان برنامه سفری است که بتواند با اطمینان از تطابقش با یادداشت‌ها ارسال کند. فاصله میان تولید متن و رسیدن به آن خروجی، چیزی است که ارزیابی بعدی باید روشن کند.

تصویر شاخص: تصویرسازی مفهومی تولیدشده با هوش مصنوعی از مسیرهای متفاوت مصرف منابع برای رسیدن به یک خروجی؛ تصویر واقعی محصول یا نمودار اندازه‌گیری‌شده نیست.

منابع

M
درباره نویسنده

تیم تحریریه مدیرم

تجربه‌های واقعی تیم مدیرم از طراحی محصول، معماری سیستم و ساخت نرم‌افزارهای قابل اتکا برای کسب‌وکارها.

همه مقاله‌ها ↗
گفتگو درباره این مطلب

نظر شما چیست؟

نظر شما برای ما ارزشمند استدیدگاه شما پس از بررسی نمایش داده می‌شود.
امتیاز شما
NEXT STEP / YOUR PROJECT

این مسئله در کسب‌وکار
شما هم واقعی است؟

برای تبدیل آن به یک سیستم روشن، سریع و قابل توسعه با ما گفتگو کنید.

شروع گفتگو ↗