لوگوی پیام رسان بلهدانلود «بله»
عکس پروفایل منابع تکنولوژیم
۴.۴ هزار عضو

منابع تکنولوژی

اخبار و آموزش های هوش مصنوعی ایرانundefined
مشاهده در اپلیکیشن بلهمشاهده در وب بله
۱۲ شهریور
thumbnail
undefined۱۱
undefined۲
undefined۱
undefined۱

۱.۶K

۱۷:۱۵

thumbnail
یه مدل جدید هم همین امروز اومده که بنظر جالب میاد: IFM/K2-Horizon
این خانواده مدل از MBZUAI (دانشگاه محمد بن زاید در ابوظبی) هست؛ یه خانواده کامل از 6 مدل منتشر کرده:از 0.9B تا 375B.همه چیز در این انتشار هم با لایسنس Apache 2.0 و کاملاً منبع باز هست، یعنی نه فقط وزن ها، بلکه کد ترینینگ، داده ها، intermediate checkpoints و لاگ های ترینینگ هم همه منتشر میشن.
بنظر میاد ستاره اصلی این خانواده دو تا مدل هستند: اولیش K2-Horizon 3.7B هست که یه مدل dense 3.7 میلیارد پارامتریه، که بنچمارک ها ادعا میکنند تو ریاضی (HMMT Feb 2026) امتیاز 70.5 گرفته، تو SWE-bench Verified امتیاز 68.6 و تو GPQA Diamond هم 65.3.دومیش K2-Horizon MoVA 36B-A4B که ی مدل MoE با معماری جدید هست به اسمMoVA (Mixture of Value Attention)که نه فقط feed-forward layers بلکه attention رو هم sparse میکنه.
برای سیستم های متوسط که ۱۶ گیگ رم دارند و حداقل ۶ گیگ گرافیک، میتونید به این دو نسخه توجه دیگه ای داشته باشید: نسخه 3.7B با کوانتیزیشن مناسب خیلی راحت روی همچین سیستمی ران میشه و با اون عملکردی که داره، واقعاً جای بحث داره.نسخه 36B-A4B هم چون فقط 4B پارامتر فعال داره، مصرف واقعیش به اندازه یه مدل 4 یا 5 میلیاردی هست و روی یه GPU با 8 گیگ گرافیک(حتی با ۴ گیگ گرافیک)، با کوآنت مناسب و با آفلود به رم قابل اجراست.
یه نکته هم ارزش گفتن داره: IFM یه چیزی به اسم Uno Diffusion هم منتشر کرده که یه LoRA adapter هست و بدون هیچ کاهش کیفیتی سرعت inference رو بالا میبره.
گفته شده با اتصال این adapter به مدل، سرعت تولید توکن بیشتر میشه بدون اینکه جوابا ضعیف تر بشن؛ مثل اینکه این مدل هنوز در llama.cpp به صورت رسمی پشتیبانی نمیشه!
وبلاگشون هم از این قراره:https://ifm.ai/blog/k2صفحه مدل ها هم این هست:https://huggingface.co/collections/IFM/k2-horizon
@ai_src
undefined۱۱
undefined۲
undefined۱
undefined۱

۱.۶K

۱۷:۱۵

۱۹ شهریور
thumbnail
undefined۱۷
undefined۲
undefined۱

۱.۳K

۹:۴۶

thumbnail
درحالی که همه دارند از مدل جدید OpenAI به نام آسترا حرف میزنن(و سعی میکنیم ی پست از معماری هاش و شایعه هایی که براش درست کردند بذاریم)، دیپ سیک مدل جدیدی بر پایه همون V4-Flash بیرون داده که جهش عظیمی محسوب میشه... حالا میگیم چرا:
اول از همه، این نسخه با آموزش بیشتر(و احتمال میدم با ی تغییر معماری قابل ملاحظه) و در نتیجه قابلیت های بیشتر، inference سریع تر و ظرفیت بیشتر ریلیز شده.
ی نکته مهم اینه که این نسخه دیگه multimodal native هستش، یعنی درک تصویر از اول داخل مدل هستش و درونش قرار داده شده، نه اینکه بعداً براش قرار بدن(مثل نسخه vision exp که چند وقت پیش اومده بود).
به بنچمارک هاش هم یک دقت بکنید:GPQA Diamond رو 90.9 گرفته که Opus5 تقریبا 93 شده
روی MathAreana دقیقا با Kimi K3 یکی شده
روی DeepSWE هم ۷۴.۲ گرفته که Opus5 ۷۴ بوده
روی HLE هم ۶۳.۹ گرفته که از Opus5 با ۶۳.۶ بیشتره
در کل میشه گفت هم روی reasoning قوی تر شده، هم روی کدنویسی، هم روی کار های multimodal(که بنچمارک هاش آخری ها هستند و می‌بینید واسه دو نسخه قبلی از v4 flash تعریف نشدن چون مدل قابلیت دیدن نداشت)
از نظر API و قیمت هم تغییراتی انجام دادند!چون دیپ سیک اومده بود قیمت مدل ها رو چندین برابر کرد و استفاده رایگان ازشون از بین رفت(چون دیگه نمیصرفید)و الان هم مدل های نسل قبل یعنی V4 Flash و V4 Flash Vision Exp بازنشسته شدن، ولی اسم هاشون توی لیست API میمونه و فعلا به V4.1 Flash هدایت میشن تا ساختارشون حفظ بشه. برای استفاده از مدل جدید هم اسم مدل رو بذارید deepseek-flash.
اما مهمترین خبر اینه که V4 Pro هم داره بازنشسته میشه!چرا؟! آزمایش ها نشون داده V4.1 Flash از همه نظر، performance، قیمت، سرعت و زمان کل از Pro بهتره! و دیپ سیک گفت استفاده از این مدل دیگه عقلانی نیست پس بهتره بازنشسته بشه!
از ۱۴ سپتامبر ۲۰۲۶ به بعد همه درخواست های deepseek-v4-pro خودکار به V4.1 Flash هدایت میشن و با قیمت پایین تر Flash حساب میشن. قیمت های API هم کاهش پیدا کرده که جزئیاتش توی صفحه Models & Pricing هستش.
مدل هم توی هاگینگ فیس منتشر شده:https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash
این بازی بالا هم با همین مدل one shot تولید شده
@ai_src
undefined۱۷
undefined۲
undefined۱

۱.۳K

۹:۴۶

۲۰ شهریور
thumbnail
خب یک مدل جدید واسه تولید موسیقی اومده:https://github.com/Comfy-Org/ComfyUI/pull/16250https://huggingface.co/m-a-p/YuE2-3Bاسمش YuE2 هست و ۳ میلیارد پارامتر دارهدرحال ادغام با ComfyUI هست و قبل از اون در audio.cpp پشتیبانی میشه:https://huggingface.co/audio-cpp/Yue2-3B-GGUFhttps://github.com/0xShug0/audio.cpp/tree/dev
چیزی که این مدل رو از بقیه جدا میکنه اینه که فقط text-to-music نیست، میتونید باهاش کاور آهنگ های موجود بسازید، و یه قابلیت جالب تر هم داره: agentic editing، یعنی یه ایده موزیکال میدید (مثلاً "هارمونی رو عوض کن، ساکسیفون اضافه کن") و مدل خودش اسکور رو ویرایش میکنه و نسخه جدید رو رندر میکنه، چند بار پشت سر هم.
از نظر بنچمارک، روی WildSongBench بهترین امتیاز بین مدل های open-source رو گرفته (6.9632 در حالت best-of-8)، حتی یکم از Suno v5 که مدل proprietary هست هم بالاتره (6.8721). معماریش ترکیبی از AR/NAR با یه Mixture-of-Transformers هست که اول اسکور نمادین (ABC) میسازه بعد از اون آهنگ رندر میکنه، و خروجی استریو 48kHz میده.
از نظر سرعت هم روی RTX 4090 یه آهنگ ۳ دقیقه ای رو حدود ۷۰ ثانیه میسازه و VRAM مصرفی حدود ۱۱ گیگ هست.
طبق تست هایی که انجام دادیم، در زبان فارسی خیلی خیلی بهتر از acestep-xl و minimax-music عمل میکنه ولی همچنان کمی ایراد خواهد داشت؛ نکته ای که هست اینه که ایرادی که acestep داشت رو نداره یا حداقل میشه گفت خیلی کم شده: صدای ناواضح
مدل acestep مشکلی که داشت این بود که موسیقی تولید شده صداش زیاد واضح نبود، ولی طبق تست هایی که انجام دادیم، صدا خیلی در این مدل واضح تر هست
@ai_src
undefined۱۴
undefined۱

۱.۲K

۱۳:۰۴

۲۳ شهریور
thumbnail
از اونجایی که من زیاد آهنگ گوش میدم، اومدم دو مدل رو تا جایی که سخت افزارم میکشید تست کردم...خب ما اومدیم و از مدل acestep xl ی خروجی گرفتیم؛ با غزل ۴۸۸ شاعر بزرگوار سعدی شیرازی(همون دغل باخته که قبلا گذاشتیم)؛ مشخصا مدل acestep پر از ایراد بود ولی نکته ای که داشت این بود که خیلی خیلی خلاقیت خوبی در نت گذاری و تولید موسیقی داره؛ ولی خروجی کمی ناواضح هستبعد اومدیم با استفاده از مدل جدید YuE2 همون آهنگ رو تولید کردیم؛ و خروجی رو گرفتیم؛ به نکته ای که رسیدیم اینه که خروجی کیفیت نسبتا بالایی داره، و کلمات فارسی(حتی کلمات سخت مثل کَبْک) رو با استفاده از حرکت گذاری(مثل ـَ‌ـِـُـْ) خیلی خوب ادا میکنه؛منتهی ی نقصی داره و اون خلاقیت کم هست توی تولید موسیقی.
به ترتیب خروجی این دو رو پایین میبینید:اولی مال acestepدومی مال YuE2
حالا داستان جالب میشه:چی میشه اگه موسیقی تولید شده از مدل acestep رو به عنوان ورودی به مدل YuE2 بدیم، تا براش کاور بسازه و مثلش بخونه؟!جواب اینه که خروجی خیلی خیلی خوب هست و تقریبا تونسته یک کاور بی نقص واسه موزیک اصلی درست کنه؛موسیقی سوم پایین، کاور تولید برای موسیقی اول هست.
نکته: تنظیمات، seed ها و پرامپت ها داخل خود فایل های موسیقی به عنوان metadtata موجود هستند و میتونید با نرم افزارهایی مثل kid3 (که واسه لینوکس میدونم موجود هست، واسه ویندوز و مک نمیدونم) بهشون دسترسی پیدا کنید(طبق تصویر)
@ai_src
undefined۹
undefined۱
undefined۱

۶۴۸

۱۸:۳۴

ACE_Step1.5_xl_turbo_00003_.mp3

۰۳:۴۲-۸.۴۹ مگابایت
undefined۷
undefined۱

۶۳۹

۱۸:۳۵

YuE2_00008.flac

۰۳:۴۸-۲۳.۵۷ مگابایت
undefined۳
undefined۲
undefined۱

۶۳۷

۱۸:۳۷

YuE2_00009-covering-acestep.flac

۰۳:۳۹-۲۱.۴۹ مگابایت
undefined۴
undefined۱
undefined۱

۶۳۷

۱۸:۳۹

و یادم رفت بگمکیفیت خروجی YuE2 میگن flac هستولی وقت نکردم bitrate رو چک کنم و مطمئن بشم؛ خودتون ی چک بکنید
@ai_Src
undefined۶

۶۳۳

۱۸:۴۳