آنتروپیک در ۲۸ سپتامبر ۲۰۲۶ مدل Claude Sonnet 5.5 را معرفی کرد و گفت این نسخه در آزمونهای خودش برای بسیاری از کارها تا ۳۰ درصد هزینه کمتری از Sonnet 5 داشته است. بااینحال، قیمت پایه هر توکن این دو نسخه یکسان اعلام شده است. این دو جمله چگونه میتوانند همزمان درست باشند؟ پاسخ، تفاوت میان نرخ مصرف و مقدار مصرف است؛ تفاوتی که برای فهم خبرهای مدلهای هوش مصنوعی، حتی بدون دانش برنامهنویسی، اهمیت دارد. این مقاله در ۱ اکتبر ۲۰۲۶ منابع را بررسی کرده و تاریخ معرفی مدل را با تاریخ بررسی خبر یکی نمیگیرد. منبع معرفی: آنتروپیک
عبارت «ارزانتر» بدون مشخص کردن واحد مقایسه ناقص است. ممکن است درباره قیمت پردازش مقدار معینی متن صحبت کنیم، یا درباره مبلغ لازم برای تمام کردن یک درخواست. در ارزیابی یک دستیار، نتیجه قابل استفاده هم مهم است: پاسخ کمهزینهای که نیاز به چند بار اصلاح دارد، تجربه متفاوتی از پاسخی دارد که همان بار اول معیارهای کار را برآورده میکند. پرسش این گزارش این است که از خبر تازه چه میدانیم و برای نتیجهگیری درباره استفاده خودمان، چه چیزهایی را هنوز باید بسنجیم.
خبر عرضه، چه چیزی را ثابت میکند؟
سازنده Sonnet 5.5 را برای کارهای روزمره با دامنه روشن، رفع اشکال و تهیه سند، اسلاید و صفحهگسترده معرفی میکند. ادعای کاهش هزینه، نتیجه آزمایشهای خود شرکت است؛ نه تضمین برای هر درخواست و هر کاربر. بنابراین خبر عرضه را باید از داوری درباره صرفه اقتصادی جدا نگه داشت. معرفی یک محصول نشان میدهد شرکت چه چیزی عرضه کرده و درباره آن چه میگوید؛ اثبات اینکه همان مزیت در کار ما هم رخ میدهد، به شواهد دیگری نیاز دارد. توضیح رسمی کاربردها و حدود ادعای هزینه
واحد کوچک متن، صورتحساب بزرگتر
توکن واحدی است که سامانه برای پردازش متن به کار میبرد و لزوماً با یک واژه برابر نیست. در جدول رسمی قیمتگذاری، نرخ پایه Sonnet 5.5 برابر ۲ دلار برای هر یک میلیون توکن ورودی و ۱۰ دلار برای هر یک میلیون توکن خروجی درج شده است. این اعداد مربوط به رابط برنامهنویسی، یعنی اتصال نرمافزارها به مدل، هستند؛ نباید آنها را قیمت یک اشتراک ماهانه یا مبلغ هر گفتگوی معمولی معرفی کرد.
همان مستند، برای استفاده دوباره از ورودی ذخیرهشده نرخ جداگانهای دارد. به زبان ساده، وقتی بخشی از متن قبلاً پردازش و در حافظه موقت نگهداری شده باشد، خواندن دوباره آن میتواند با نرخ متفاوتی حساب شود. پس حتی دو درخواست با طول ظاهراً یکسان، بدون دانستن ترکیب ورودی، خروجی و استفاده از حافظه موقت، مقایسه کاملی ندارند. جدول قیمت نقطه شروع محاسبه است؛ مقدار واقعی مصرف تعیین میکند حاصل ضرب نهایی چقدر شود.
آزمون مستقل، با نام کامل تنظیمات
در زمان بررسی این گزارش، صفحه ارزیابی Artificial Analysis برای Sonnet 5.5 با استدلال تطبیقی، سطح تلاش Max و fallback پیشفرض، هزینه متوسط ۷٫۶۲ دلار بهازای هر وظیفه در شاخص هوش خود نشان میداد. fallback یعنی امکان بازگشت سامانه به مدل جایگزین طبق تنظیمات سرویس. عدد بالا برای همان مجموعه آزمون و همان پیکربندی است؛ قیمت یک پیام کوتاه، خلاصهسازی روزانه یا همه کارهای مردم نیست.
این ارزیاب هزینه هر وظیفه را با در نظر گرفتن توکنهای ورودی، خروجی، استدلال و حافظه موقت و وزن آزمونها محاسبه میکند. در نتیجه، عدد آن با یک ادعای کلی درباره کاهش هزینه نسبت به نسل قبل، بدون یکسان کردن شرایط قابل مقایسه مستقیم نیست. اینجا شاهدی مستقل از سازنده داریم، اما استقلال منبع به معنای پوشش همه کاربردها نیست. بهویژه از همین عدد نمیتوان درباره کیفیت نوشتن فارسی یا میزان اصلاح لازم برای یک سند مشخص حکم داد.
دکمه «تلاش بیشتر» چه چیزی را تغییر میدهد؟
در راهنمای رسمی سطح تلاش، effort به میزان منابعی مربوط است که مدل برای انجام درخواست صرف میکند. این تنظیم، انتخاب مدل را عوض نمیکند؛ به همان مدل علامت میدهد چقدر کار و بررسی انجام دهد. سطح بالاتر میتواند به مصرف توکن و زمان بیشتر منجر شود. سطح پایینتر هم ممکن است برای یک مسئله پیچیده کافی نباشد و کار را ناتمام بگذارد. بنابراین بیشترین مقدار، پاسخ خودکار به همه نیازها نیست.
راهنمای سازنده پیشنهاد میکند از تنظیم پیشفرض شروع شود و تغییر، متناسب با نتیجه مشاهدهشده باشد. برداشت کاربردی ما این است که نام مدل و سطح تلاش باید کنار هم ثبت شوند؛ مقایسه دو خروجی وقتی یکی با تنظیم سبک و دیگری با تنظیم سنگین تولید شده، فقط مقایسه نام دو مدل نیست. این یک روش پیشنهادی برای منصفانهتر کردن مشاهده است، نه ادعای اینکه سطح خاصی برای همه کاربران بهترین خواهد بود.
نکته کمتر قابل مشاهده در راهنمای مهاجرت Sonnet 5.5 آمده است: توکنهای مرحله استدلال در صورتحساب خروجی حساب میشوند، حتی وقتی متن آن مرحله بهطور پیشفرض نمایش داده نمیشود. در نتیجه، کوتاه بودن پاسخ نهایی بهتنهایی نشاندهنده کم بودن کل مصرف نیست. این نکته برای سازندگان برنامهها مهم است؛ کسی که فقط چند خط نتیجه را میبیند، الزاماً همه پردازش انجامشده پشت آن نتیجه را نمیبیند.
یک نمونه فرضی: خلاصهای که واقعاً آماده ارسال باشد
برای ملموس شدن بحث، یک سناریوی کاملاً فرضی را در نظر بگیرید. فردی میخواهد یادداشتهای یک سفر گروهی را به برنامهای کوتاه تبدیل کند. پیش از استفاده از دستیار، سه شرط مینویسد: ساعتها از متن اصلی تغییر نکنند، برنامه پیشنهادی از رزرو قطعی جدا باشد و اطلاعات ناموجود ساخته نشود. این مثال، گزارش آزمایش Sonnet یا تجربه واقعی یک کاربر نیست؛ روشی برای تعریف «کار تمامشده» است.
اکنون فرض کنید دو خروجی ظاهر مرتب و متن روانی دارند. در یکی، دستیار یک ساعت حرکت ناموجود اضافه کرده است؛ در دیگری، همان مورد با عبارت «هنوز مشخص نشده» باقی مانده است. اگر فقط سرعت ظاهر شدن متن را ثبت کنیم، تفاوت اصلی گم میشود. معیار پیشنهادی در این مثال، زمان رسیدن به برنامه قابل ارسال است؛ از اولین درخواست تا پایان تطبیق ساعتها و اصلاح اطلاعات. ممکن است خروجی سریعتر، بازبینی بیشتری بخواهد یا برعکس؛ نتیجه از پیش معلوم نیست.
برای چنین مقایسهای میتوان همان یادداشتها و همان دستور را در چند اجرای جدا به کار برد و نام نسخه، تنظیم تلاش، موارد خطا و زمان بازبینی را کنار نتیجه نوشت. اگر هزینه مصرف در دسترس باشد، آن هم ثبت میشود. این پیشنهاد تحریریه برای یک آزمون شخصی محدود است. چند نمونه کوچک، برتری عمومی یک مدل را اثبات نمیکند، ولی روشن میکند کدام بخش کار خودمان هنوز به اصلاح نیاز دارد. هیچ نتیجه عددی برای این سناریو اندازهگیری نشده است.
خبر Sonnet 5.5 فرصتی است برای دقیقتر خواندن واژه «ارزانتر». تا وقتی نوع کار، تنظیمات و معیار قبول نتیجه مشخص نباشند، یک نرخ یا درصد بهتنهایی پاسخ کافی نمیدهد. مشاهده تعیینکننده برای کاربرِ مثال ما، همان برنامه سفری است که بتواند با اطمینان از تطابقش با یادداشتها ارسال کند. فاصله میان تولید متن و رسیدن به آن خروجی، چیزی است که ارزیابی بعدی باید روشن کند.
تصویر شاخص: تصویرسازی مفهومی تولیدشده با هوش مصنوعی از مسیرهای متفاوت مصرف منابع برای رسیدن به یک خروجی؛ تصویر واقعی محصول یا نمودار اندازهگیریشده نیست.
نظر شما چیست؟