بهار فناوری

آنتروپیک از مدل Claude Sonnet 5.5 به‌عنوان دومین مدل خانواده Claude 5.5 رونمایی کرد. این مدل در مقایسه با Sonnet 5 بیش از ۳۰ درصد سریع‌تر است و به‌دلیل نیاز به توکن‌های کمتر برای انجام تسک‌های مشابه، هزینه اجرای هر کار با آن می‌تواند تا ۳۰ درصد کاهش پیدا کند.

مدل سونت ۵.۵ در خانواده کلاد ۵.۵ بین مدل‌های مختلف قرار می‌گیرد. آنتروپیک می‌گوید کلاد اوپوس ۵.۵ برای کارهای پیچیده‌ای ساخته شده که به قضاوت و بررسی مداوم نیاز دارند، درحالی‌که سونت ۵.۵ بیشتر برای تسک‌های روزمره و مشخص، رفع باگ، و ساخت اسناد، ارائه‌ها و صفحات گسترده طراحی شده است. مدل کلاد هایکو ۵.۵  نیز قرار است در هفته‌های آینده به این خانواده اضافه شود و برای کاربردهای پرتعداد و حساس به هزینه در نظر گرفته شده است.

در ویدیو پایین می‌توانید سرعت این مدل را در مقایسه با مدل قبلی آنتروپیک مشاهده کنید:

عملکرد مدل Claude Sonnet 5.5

Sonnet 5.5 در ارزیابی Terminal-Bench 4.0 که عملکرد ایجنت‌های هوش مصنوعی در کدنویسی را می‌سنجد، به امتیاز ۷۰.۶ درصد رسیده است؛ درحالی‌که Sonnet 5 در همین آزمون امتیاز ۱۰.۳ درصد کسب کرده بود.

مدل Claude Sonnet 5.5 معرفی شد؛ ۳۰ درصد سریع‌تر و ارزان‌تر از مدل قبلی [تماشا کنید]

این مدل در ارزیابی GDPval-AA که عملکرد مدل‌ها را در کارهای واقعی در مشاغل مختلف بررسی می‌کند نیز فقط دو امتیاز با Opus 5.5 فاصله دارد. آنتروپیک همچنین می‌گوید Sonnet 5.5 در کارهای طولانی‌مدت و درک تصاویر عملکرد خوبی دارد و اولین مدل سونت است که توانسته بازی Pokémon Red را تنها با استفاده از تصاویر صفحه‌نمایش پشت سر بگذارد.

در برخی ارزیابی‌ها، Sonnet 5.5 در حالت بیشترین میزان تلاش (Max effort) عملکردی قابل مقایسه با Opus 5.5 دارد. بااین‌حال، آنتروپیک تأکید می‌کند که امتیازهای بنچمارک تنها بخشی از توانایی مدل را نشان می‌دهند و Opus 5.5 همچنان در کارهای پیچیده و باز که به قضاوت مستمر نیاز دارند، عملکرد قوی‌تری دارد.

به گفته آنتروپیک، بهبود Sonnet 5.5 در کدنویسی بیش از سایر حوزه‌ها قابل توجه است. این مدل در حالت High در آزمون FrontierCode، با همان تنظیمات، ۱۰ امتیاز بیشتر از Sonnet 5 به دست آورده و هزینه هر کار در این آزمون حدود یک‌پانزدهم Sonnet 5 بوده است.

در CursorBench که تسک‌های برگرفته از جلسات واقعی کدنویسی با Cursor را بررسی می‌کند، بهترین امتیاز Sonnet 5.5 حدود دو امتیاز با Opus 5.5 فاصله دارد. آزمایش‌کنندگان اولیه همچنین گفته‌اند Sonnet 5.5 می‌تواند کدبیس‌ها را سریع‌تر درک کند.

Sonnet 5.5 در چندین حوزه از کارهای دانش‌محور نیز نسبت به نسل قبلی پیشرفت کرده است. در GDPval-AA که وظایف واقعی در ۴۴ شغل و ۹ صنعت اصلی را بررسی می‌کند، امتیاز آن تقریباً با Opus 5.5 برابر است و حدود ۴۰۰ امتیاز بالاتر از Sonnet 5 قرار دارد.

این مدل در استفاده از کامپیوتر و تشخیص نمودار نیز به Opus 5.5 نزدیک شده و در کارهای دانش‌محور طولانی‌مدت، عملکرد بهتری از Sonnet 5 و GPT-6 Sol نشان می‌دهد. آنتروپیک در یک آزمایش داخلی، گزارش‌های مالی فصلی و متن تماس‌های درآمدی یک شرکت بورسی را در اختیار مدل قرار داد و از آن خواست یک ارائه ۱۰ اسلایدی برای بررسی عملکرد عملیاتی ایجاد کند. دو متخصص نسخه اولیه را آماده ارسال و بدون نیاز به ویرایش بیشتر ارزیابی کردند.

امنیت مدل کلاد سونت ۵.۵ چقدر است؟

آنتروپیک می‌گوید Sonnet 5.5 در ارزیابی خودکار رفتاری که حدود ۱٬۸۵۰ سناریو را بررسی می‌کند، در بیشتر معیارهای همسویی (Alignment)، مقاومت در برابر سوءاستفاده و صداقت، نسبت به Sonnet 5 بهبود یافته یا عملکرد مشابهی دارد.

مدل Claude Sonnet 5.5 معرفی شد؛ ۳۰ درصد سریع‌تر و ارزان‌تر از مدل قبلی [تماشا کنید]

بااین‌حال، این شرکت اذعان دارد هیچ مجموعه‌ای از ارزیابی‌ها نمی‌تواند همه خطاهای احتمالی مدل را شناسایی کند و ممکن است رفتارهایی در Sonnet 5.5 وجود داشته باشد که هنوز شناسایی نشده‌اند.

از نظر امنیت سایبری، آنتروپیک می‌گوید قابلیت‌های Sonnet 5.5 نسبت به Sonnet 5 به‌طور قابل توجهی افزایش یافته و به همین دلیل این مدل با تدابیر ایمنی مشابه Opus 5.5 عرضه شده است. این مدل همچنین نخستین مدل Sonnet است که با طبقه‌بندی ایمنی خاصی برای جلوگیری از استخراج فرایند استدلال عرضه می‌شود.

قیمت Sonnet 5.5

قیمت اسمی Sonnet 5.5 نسبت به Sonnet 5 تغییری نکرده است. هزینه ورودی برای هر یک میلیون توکن ۲ دلار و هزینه خروجی ۱۰ دلار است. هزینه خواندن توکن‌های ذخیره‌شده نیز ۰.۲۰ دلار به ازای هر یک میلیون توکن است و نوشتن توکن‌های ذخیره‌شده ۲.۵۰ دلار هزینه دارد.

مدل Claude Sonnet 5.5 معرفی شد؛ ۳۰ درصد سریع‌تر و ارزان‌تر از مدل قبلی [تماشا کنید]

با وجود ثابت ماندن قیمت هر توکن، Sonnet 5.5 برای انجام یک وظیفه مشابه معمولاً به توکن‌های کمتری نیاز دارد. آنتروپیک بر اساس آزمایش‌های خود می‌گوید هزینه هر کار با این مدل می‌تواند تا ۳۰ درصد کمتر از Sonnet 5 باشد. Sonnet 5.5 همچنین بیش از ۳۰ درصد سریع‌تر از Sonnet 5 خروجی تولید می‌کند و آنتروپیک آن را سریع‌ترین مدل Sonnet خود تاکنون می‌داند.

Claude Sonnet 5.5 اکنون در همه پلتفرم‌های مثل سرویس وب آمازون و Microsoft Azure در دسترس است. توسعه‌دهندگان می‌توانند از طریق Claude Platform و با شناسه claude-sonnet-5-5 به این مدل دسترسی پیدا کنند.

ارسال دیدگاه

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

7 + بیست =