۱.۶K
۱۷:۱۵
یه مدل جدید هم همین امروز اومده که بنظر جالب میاد: IFM/K2-Horizon
این خانواده مدل از MBZUAI (دانشگاه محمد بن زاید در ابوظبی) هست؛ یه خانواده کامل از 6 مدل منتشر کرده:از 0.9B تا 375B.همه چیز در این انتشار هم با لایسنس Apache 2.0 و کاملاً منبع باز هست، یعنی نه فقط وزن ها، بلکه کد ترینینگ، داده ها، intermediate checkpoints و لاگ های ترینینگ هم همه منتشر میشن.
بنظر میاد ستاره اصلی این خانواده دو تا مدل هستند: اولیش K2-Horizon 3.7B هست که یه مدل dense 3.7 میلیارد پارامتریه، که بنچمارک ها ادعا میکنند تو ریاضی (HMMT Feb 2026) امتیاز 70.5 گرفته، تو SWE-bench Verified امتیاز 68.6 و تو GPQA Diamond هم 65.3.دومیش K2-Horizon MoVA 36B-A4B که ی مدل MoE با معماری جدید هست به اسمMoVA (Mixture of Value Attention)که نه فقط feed-forward layers بلکه attention رو هم sparse میکنه.
برای سیستم های متوسط که ۱۶ گیگ رم دارند و حداقل ۶ گیگ گرافیک، میتونید به این دو نسخه توجه دیگه ای داشته باشید: نسخه 3.7B با کوانتیزیشن مناسب خیلی راحت روی همچین سیستمی ران میشه و با اون عملکردی که داره، واقعاً جای بحث داره.نسخه 36B-A4B هم چون فقط 4B پارامتر فعال داره، مصرف واقعیش به اندازه یه مدل 4 یا 5 میلیاردی هست و روی یه GPU با 8 گیگ گرافیک(حتی با ۴ گیگ گرافیک)، با کوآنت مناسب و با آفلود به رم قابل اجراست.
یه نکته هم ارزش گفتن داره: IFM یه چیزی به اسم Uno Diffusion هم منتشر کرده که یه LoRA adapter هست و بدون هیچ کاهش کیفیتی سرعت inference رو بالا میبره.
گفته شده با اتصال این adapter به مدل، سرعت تولید توکن بیشتر میشه بدون اینکه جوابا ضعیف تر بشن؛ مثل اینکه این مدل هنوز در llama.cpp به صورت رسمی پشتیبانی نمیشه!
وبلاگشون هم از این قراره:https://ifm.ai/blog/k2صفحه مدل ها هم این هست:https://huggingface.co/collections/IFM/k2-horizon
@ai_src
این خانواده مدل از MBZUAI (دانشگاه محمد بن زاید در ابوظبی) هست؛ یه خانواده کامل از 6 مدل منتشر کرده:از 0.9B تا 375B.همه چیز در این انتشار هم با لایسنس Apache 2.0 و کاملاً منبع باز هست، یعنی نه فقط وزن ها، بلکه کد ترینینگ، داده ها، intermediate checkpoints و لاگ های ترینینگ هم همه منتشر میشن.
بنظر میاد ستاره اصلی این خانواده دو تا مدل هستند: اولیش K2-Horizon 3.7B هست که یه مدل dense 3.7 میلیارد پارامتریه، که بنچمارک ها ادعا میکنند تو ریاضی (HMMT Feb 2026) امتیاز 70.5 گرفته، تو SWE-bench Verified امتیاز 68.6 و تو GPQA Diamond هم 65.3.دومیش K2-Horizon MoVA 36B-A4B که ی مدل MoE با معماری جدید هست به اسمMoVA (Mixture of Value Attention)که نه فقط feed-forward layers بلکه attention رو هم sparse میکنه.
برای سیستم های متوسط که ۱۶ گیگ رم دارند و حداقل ۶ گیگ گرافیک، میتونید به این دو نسخه توجه دیگه ای داشته باشید: نسخه 3.7B با کوانتیزیشن مناسب خیلی راحت روی همچین سیستمی ران میشه و با اون عملکردی که داره، واقعاً جای بحث داره.نسخه 36B-A4B هم چون فقط 4B پارامتر فعال داره، مصرف واقعیش به اندازه یه مدل 4 یا 5 میلیاردی هست و روی یه GPU با 8 گیگ گرافیک(حتی با ۴ گیگ گرافیک)، با کوآنت مناسب و با آفلود به رم قابل اجراست.
یه نکته هم ارزش گفتن داره: IFM یه چیزی به اسم Uno Diffusion هم منتشر کرده که یه LoRA adapter هست و بدون هیچ کاهش کیفیتی سرعت inference رو بالا میبره.
گفته شده با اتصال این adapter به مدل، سرعت تولید توکن بیشتر میشه بدون اینکه جوابا ضعیف تر بشن؛ مثل اینکه این مدل هنوز در llama.cpp به صورت رسمی پشتیبانی نمیشه!
وبلاگشون هم از این قراره:https://ifm.ai/blog/k2صفحه مدل ها هم این هست:https://huggingface.co/collections/IFM/k2-horizon
@ai_src
۱.۶K
۱۷:۱۵
۱.۳K
۹:۴۶
درحالی که همه دارند از مدل جدید OpenAI به نام آسترا حرف میزنن(و سعی میکنیم ی پست از معماری هاش و شایعه هایی که براش درست کردند بذاریم)، دیپ سیک مدل جدیدی بر پایه همون V4-Flash بیرون داده که جهش عظیمی محسوب میشه... حالا میگیم چرا:
اول از همه، این نسخه با آموزش بیشتر(و احتمال میدم با ی تغییر معماری قابل ملاحظه) و در نتیجه قابلیت های بیشتر، inference سریع تر و ظرفیت بیشتر ریلیز شده.
ی نکته مهم اینه که این نسخه دیگه multimodal native هستش، یعنی درک تصویر از اول داخل مدل هستش و درونش قرار داده شده، نه اینکه بعداً براش قرار بدن(مثل نسخه vision exp که چند وقت پیش اومده بود).
به بنچمارک هاش هم یک دقت بکنید:GPQA Diamond رو 90.9 گرفته که Opus5 تقریبا 93 شده
روی MathAreana دقیقا با Kimi K3 یکی شده
روی DeepSWE هم ۷۴.۲ گرفته که Opus5 ۷۴ بوده
روی HLE هم ۶۳.۹ گرفته که از Opus5 با ۶۳.۶ بیشتره
در کل میشه گفت هم روی reasoning قوی تر شده، هم روی کدنویسی، هم روی کار های multimodal(که بنچمارک هاش آخری ها هستند و میبینید واسه دو نسخه قبلی از v4 flash تعریف نشدن چون مدل قابلیت دیدن نداشت)
از نظر API و قیمت هم تغییراتی انجام دادند!چون دیپ سیک اومده بود قیمت مدل ها رو چندین برابر کرد و استفاده رایگان ازشون از بین رفت(چون دیگه نمیصرفید)و الان هم مدل های نسل قبل یعنی V4 Flash و V4 Flash Vision Exp بازنشسته شدن، ولی اسم هاشون توی لیست API میمونه و فعلا به V4.1 Flash هدایت میشن تا ساختارشون حفظ بشه. برای استفاده از مدل جدید هم اسم مدل رو بذارید deepseek-flash.
اما مهمترین خبر اینه که V4 Pro هم داره بازنشسته میشه!چرا؟! آزمایش ها نشون داده V4.1 Flash از همه نظر، performance، قیمت، سرعت و زمان کل از Pro بهتره! و دیپ سیک گفت استفاده از این مدل دیگه عقلانی نیست پس بهتره بازنشسته بشه!
از ۱۴ سپتامبر ۲۰۲۶ به بعد همه درخواست های deepseek-v4-pro خودکار به V4.1 Flash هدایت میشن و با قیمت پایین تر Flash حساب میشن. قیمت های API هم کاهش پیدا کرده که جزئیاتش توی صفحه Models & Pricing هستش.
مدل هم توی هاگینگ فیس منتشر شده:https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash
این بازی بالا هم با همین مدل one shot تولید شده
@ai_src
اول از همه، این نسخه با آموزش بیشتر(و احتمال میدم با ی تغییر معماری قابل ملاحظه) و در نتیجه قابلیت های بیشتر، inference سریع تر و ظرفیت بیشتر ریلیز شده.
ی نکته مهم اینه که این نسخه دیگه multimodal native هستش، یعنی درک تصویر از اول داخل مدل هستش و درونش قرار داده شده، نه اینکه بعداً براش قرار بدن(مثل نسخه vision exp که چند وقت پیش اومده بود).
به بنچمارک هاش هم یک دقت بکنید:GPQA Diamond رو 90.9 گرفته که Opus5 تقریبا 93 شده
روی MathAreana دقیقا با Kimi K3 یکی شده
روی DeepSWE هم ۷۴.۲ گرفته که Opus5 ۷۴ بوده
روی HLE هم ۶۳.۹ گرفته که از Opus5 با ۶۳.۶ بیشتره
در کل میشه گفت هم روی reasoning قوی تر شده، هم روی کدنویسی، هم روی کار های multimodal(که بنچمارک هاش آخری ها هستند و میبینید واسه دو نسخه قبلی از v4 flash تعریف نشدن چون مدل قابلیت دیدن نداشت)
از نظر API و قیمت هم تغییراتی انجام دادند!چون دیپ سیک اومده بود قیمت مدل ها رو چندین برابر کرد و استفاده رایگان ازشون از بین رفت(چون دیگه نمیصرفید)و الان هم مدل های نسل قبل یعنی V4 Flash و V4 Flash Vision Exp بازنشسته شدن، ولی اسم هاشون توی لیست API میمونه و فعلا به V4.1 Flash هدایت میشن تا ساختارشون حفظ بشه. برای استفاده از مدل جدید هم اسم مدل رو بذارید deepseek-flash.
اما مهمترین خبر اینه که V4 Pro هم داره بازنشسته میشه!چرا؟! آزمایش ها نشون داده V4.1 Flash از همه نظر، performance، قیمت، سرعت و زمان کل از Pro بهتره! و دیپ سیک گفت استفاده از این مدل دیگه عقلانی نیست پس بهتره بازنشسته بشه!
از ۱۴ سپتامبر ۲۰۲۶ به بعد همه درخواست های deepseek-v4-pro خودکار به V4.1 Flash هدایت میشن و با قیمت پایین تر Flash حساب میشن. قیمت های API هم کاهش پیدا کرده که جزئیاتش توی صفحه Models & Pricing هستش.
مدل هم توی هاگینگ فیس منتشر شده:https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash
این بازی بالا هم با همین مدل one shot تولید شده
@ai_src
۱.۳K
۹:۴۶
خب یک مدل جدید واسه تولید موسیقی اومده:https://github.com/Comfy-Org/ComfyUI/pull/16250https://huggingface.co/m-a-p/YuE2-3Bاسمش YuE2 هست و ۳ میلیارد پارامتر دارهدرحال ادغام با ComfyUI هست و قبل از اون در audio.cpp پشتیبانی میشه:https://huggingface.co/audio-cpp/Yue2-3B-GGUFhttps://github.com/0xShug0/audio.cpp/tree/dev
چیزی که این مدل رو از بقیه جدا میکنه اینه که فقط text-to-music نیست، میتونید باهاش کاور آهنگ های موجود بسازید، و یه قابلیت جالب تر هم داره: agentic editing، یعنی یه ایده موزیکال میدید (مثلاً "هارمونی رو عوض کن، ساکسیفون اضافه کن") و مدل خودش اسکور رو ویرایش میکنه و نسخه جدید رو رندر میکنه، چند بار پشت سر هم.
از نظر بنچمارک، روی WildSongBench بهترین امتیاز بین مدل های open-source رو گرفته (6.9632 در حالت best-of-8)، حتی یکم از Suno v5 که مدل proprietary هست هم بالاتره (6.8721). معماریش ترکیبی از AR/NAR با یه Mixture-of-Transformers هست که اول اسکور نمادین (ABC) میسازه بعد از اون آهنگ رندر میکنه، و خروجی استریو 48kHz میده.
از نظر سرعت هم روی RTX 4090 یه آهنگ ۳ دقیقه ای رو حدود ۷۰ ثانیه میسازه و VRAM مصرفی حدود ۱۱ گیگ هست.
طبق تست هایی که انجام دادیم، در زبان فارسی خیلی خیلی بهتر از acestep-xl و minimax-music عمل میکنه ولی همچنان کمی ایراد خواهد داشت؛ نکته ای که هست اینه که ایرادی که acestep داشت رو نداره یا حداقل میشه گفت خیلی کم شده: صدای ناواضح
مدل acestep مشکلی که داشت این بود که موسیقی تولید شده صداش زیاد واضح نبود، ولی طبق تست هایی که انجام دادیم، صدا خیلی در این مدل واضح تر هست
@ai_src
چیزی که این مدل رو از بقیه جدا میکنه اینه که فقط text-to-music نیست، میتونید باهاش کاور آهنگ های موجود بسازید، و یه قابلیت جالب تر هم داره: agentic editing، یعنی یه ایده موزیکال میدید (مثلاً "هارمونی رو عوض کن، ساکسیفون اضافه کن") و مدل خودش اسکور رو ویرایش میکنه و نسخه جدید رو رندر میکنه، چند بار پشت سر هم.
از نظر بنچمارک، روی WildSongBench بهترین امتیاز بین مدل های open-source رو گرفته (6.9632 در حالت best-of-8)، حتی یکم از Suno v5 که مدل proprietary هست هم بالاتره (6.8721). معماریش ترکیبی از AR/NAR با یه Mixture-of-Transformers هست که اول اسکور نمادین (ABC) میسازه بعد از اون آهنگ رندر میکنه، و خروجی استریو 48kHz میده.
از نظر سرعت هم روی RTX 4090 یه آهنگ ۳ دقیقه ای رو حدود ۷۰ ثانیه میسازه و VRAM مصرفی حدود ۱۱ گیگ هست.
طبق تست هایی که انجام دادیم، در زبان فارسی خیلی خیلی بهتر از acestep-xl و minimax-music عمل میکنه ولی همچنان کمی ایراد خواهد داشت؛ نکته ای که هست اینه که ایرادی که acestep داشت رو نداره یا حداقل میشه گفت خیلی کم شده: صدای ناواضح
مدل acestep مشکلی که داشت این بود که موسیقی تولید شده صداش زیاد واضح نبود، ولی طبق تست هایی که انجام دادیم، صدا خیلی در این مدل واضح تر هست
@ai_src
۱.۲K
۱۳:۰۴
از اونجایی که من زیاد آهنگ گوش میدم، اومدم دو مدل رو تا جایی که سخت افزارم میکشید تست کردم...خب ما اومدیم و از مدل acestep xl ی خروجی گرفتیم؛ با غزل ۴۸۸ شاعر بزرگوار سعدی شیرازی(همون دغل باخته که قبلا گذاشتیم)؛ مشخصا مدل acestep پر از ایراد بود ولی نکته ای که داشت این بود که خیلی خیلی خلاقیت خوبی در نت گذاری و تولید موسیقی داره؛ ولی خروجی کمی ناواضح هستبعد اومدیم با استفاده از مدل جدید YuE2 همون آهنگ رو تولید کردیم؛ و خروجی رو گرفتیم؛ به نکته ای که رسیدیم اینه که خروجی کیفیت نسبتا بالایی داره، و کلمات فارسی(حتی کلمات سخت مثل کَبْک) رو با استفاده از حرکت گذاری(مثل ـَـِـُـْ) خیلی خوب ادا میکنه؛منتهی ی نقصی داره و اون خلاقیت کم هست توی تولید موسیقی.
به ترتیب خروجی این دو رو پایین میبینید:اولی مال acestepدومی مال YuE2
حالا داستان جالب میشه:چی میشه اگه موسیقی تولید شده از مدل acestep رو به عنوان ورودی به مدل YuE2 بدیم، تا براش کاور بسازه و مثلش بخونه؟!جواب اینه که خروجی خیلی خیلی خوب هست و تقریبا تونسته یک کاور بی نقص واسه موزیک اصلی درست کنه؛موسیقی سوم پایین، کاور تولید برای موسیقی اول هست.
نکته: تنظیمات، seed ها و پرامپت ها داخل خود فایل های موسیقی به عنوان metadtata موجود هستند و میتونید با نرم افزارهایی مثل kid3 (که واسه لینوکس میدونم موجود هست، واسه ویندوز و مک نمیدونم) بهشون دسترسی پیدا کنید(طبق تصویر)
@ai_src
به ترتیب خروجی این دو رو پایین میبینید:اولی مال acestepدومی مال YuE2
حالا داستان جالب میشه:چی میشه اگه موسیقی تولید شده از مدل acestep رو به عنوان ورودی به مدل YuE2 بدیم، تا براش کاور بسازه و مثلش بخونه؟!جواب اینه که خروجی خیلی خیلی خوب هست و تقریبا تونسته یک کاور بی نقص واسه موزیک اصلی درست کنه؛موسیقی سوم پایین، کاور تولید برای موسیقی اول هست.
نکته: تنظیمات، seed ها و پرامپت ها داخل خود فایل های موسیقی به عنوان metadtata موجود هستند و میتونید با نرم افزارهایی مثل kid3 (که واسه لینوکس میدونم موجود هست، واسه ویندوز و مک نمیدونم) بهشون دسترسی پیدا کنید(طبق تصویر)
@ai_src
۶۴۸
۱۸:۳۴
ACE_Step1.5_xl_turbo_00003_.mp3
۰۳:۴۲-۸.۴۹ مگابایت
۶۳۹
۱۸:۳۵
YuE2_00008.flac
۰۳:۴۸-۲۳.۵۷ مگابایت
۶۳۷
۱۸:۳۷
YuE2_00009-covering-acestep.flac
۰۳:۳۹-۲۱.۴۹ مگابایت
۶۳۷
۱۸:۳۹
و یادم رفت بگمکیفیت خروجی YuE2 میگن flac هستولی وقت نکردم bitrate رو چک کنم و مطمئن بشم؛ خودتون ی چک بکنید
@ai_Src
@ai_Src
۶۳۳
۱۸:۴۳