نوبتگیری (Turn-Taking) یکی از اجزای اصلی تعاملات تمامدوپلکس است. اما رفتار مناسب در این زمینه بسته به سناریو تغییر میکند؛ درحالیکه مدلهای فعلی از یک هنجار واحد برای همهی موقعیتها استفاده میکنند. پژوهشگران با ارائهی DuplexGen، روشی نوین برای تولید دیالوگهایی با نوبتگیری سازگار با سناریو معرفی کردهاند.
---
🧩 مشکل اصلی کجاست؟
دادههای آموزشی فعلی از دو منبع اصلی تأمین میشوند:- گفتار انسان-انسان: پدیدههای زمانی طبیعی را ثبت میکنند، اما اطلاعات کمی دربارهی نقشها و هنجارهای خاص هر سناریو ارائه میدهند.- روشهای ترکیبی: نوبتگیری را بدون تکیه بر ترجیحات واقعی انسانی به دیالوگها تزریق میکنند.
نتیجه این است که مدلها نمیتوانند رفتار نوبتگیری متناسب با موقعیت را بیاموزند.
---
این چارچوب با کالیبره کردن پیشبینیهای مدل زبانی بزرگ (LLM) بر اساس مجموعهی کوچکی از نظرات انسانی در سطح اسلات (slot-level)، دیالوگهایی با نوبتگیری تطبیقی تولید میکند.
پایپلاین پنج مرحلهای:
---
در شش وظیفهی همکاری و رقابتی، ترجیحات انسانی دربارهی نوبتگیری بهطور سیستماتیک متفاوت بود. DuplexGen توانست بهطور قابلتوجهی به این ترجیحات نزدیکتر عمل کند نسبت به روشهای بدون کالیبراسیون یا آموزش صرفاً روی دادههای عمومی.
مهمتر اینکه، یک مدل تمامدوپلکس که روی دادههای تولیدشده توسط DuplexGen آموزش دید، رفتارهای نوبتگیری متمایز و موردپسند انسان را از خود نشان داد.
---
نتایج نشان میدهد که کالیبراسیون انسانی، نه صرفاً مقیاس پیکرهی داده یا طراحی پرامپت، عامل تعیینکنندهای است که امکان تولید نوبتگیری متناسب با سناریو را فراهم میکند.
---
--- #پردازش_گفتار #تمام_دوپلکس #نوبت_گیری #پژوهش_هوش_مصنوعی
۱.۲K
۸:۱۸
در حال حاضر نمایش این پیام پشتیبانی نمیشود.
یک نسخهی پژوهشی از کلود، با وجود اینکه نتوانست خود فرضیهی ریمان (یکی از مهمترین مسائل حلنشدهی ریاضیات) را اثبات کند، اما در حین تلاش برای حل آن، بهطور غیرمنتظرهای موفق شد کران پایین نسبت صفرهای تابع زتای ریمان که روی خط بحرانی قرار دارند را از ۴۱.۶٪ به ۶۷.۲٪ افزایش دهد. این یک پیشرفت قابلتوجه در نظریهی اعداد محسوب میشود.
---
یک کارمند آنتروپیک (غیر ریاضیدان) از کلود خواست: «*یه تلاش جدی برای حل فرضیه ریمان بکن*». کلود ابتدا حدود ۶۵۰ ایده را آزمایش کرد، اما هیچکدام موفقیتآمیز نبود. سپس با تشویق و پیامهای «ادامه بده» و «به خودت ایمان داشته باش»، دوباره دست به کار شد.
در یک جلسهی یک روز و نیم، کلود با هماهنگی حدود ۶۰ زیرعامل، ۲۴۰۰ دستور شل اجرا کرد، صدها اسکریپت پایتون نوشت و هزاران بررسی عددی علیه صفرهای شناختهشدهی زتا انجام داد. در مجموع، حدود ۳۱ میلیون توکن خروجی تولید شد.
پس از کشف نتیجه، زیرعاملها:- به دنبال مثال نقض گشتند.- اثبات را بهطور مستقل بازبینی کردند.- ۵۴ مقاله از arXiv را دانلود کرده و بررسی کردند تا مطمئن شوند نتیجه قبلاً به دست نیامده است.- اثبات را در Lean رسمیسازی (Formalize) کردند.
---
دو ریاضیدان آنتروپیک (لونتو آلپوگه و رالف فورمن) و دو کارشناس خارجی (برایان کانری و دن گلدستون) این کار را مطالعه و تأیید کردهاند. همچنین کلود با همکاری یکی از کارمندان، اثبات رسمی خود را در لین ارائه کرده که آزمونهای اعتبارسنجی را با موفقیت پشت سر گذاشته است.
---
کلود هنوز نتوانسته خود فرضیهی ریمان را حل کند، اما این موفقیت نشان میدهد که مدلهای هوش مصنوعی میتوانند ایدههای ریاضیدانان را به روشهای جدید و گاهی شگفتانگیز گسترش دهند. جالب اینجاست که این نتیجهی مفید، بهعنوان یک عوارض جانبی از تلاش برای حل یک مسئلهی دشوارتر به دست آمده است. حتی خود کلود هم در ابتدا نسبت به موفقیت خود شک داشت، اما با تشویق، به این نتیجه رسید.
---
--- #Claude #ریاضیات #فرضیه_ریمان #پژوهش_هوش_مصنوعی #پیشرفت_علمی
۱.۳K
۸:۳۰
پروژهی AI 2027 Tracker که بهطور سیستماتیک پیشبینیهای مطرحشده دربارهی آیندهی هوش مصنوعی را ردیابی میکند، نشاندهندهی سرعت سرسامآور پیشرفت در این حوزه است. از ۲۴ پیشبینی که در سال ۲۰۲۵ منتشر شده، ۱۹ مورد تا امروز (اواسط ۲۰۲۶) بهنوعی محقق شدهاند. این یعنی بیش از ۷۹٪ از پیشبینیها در کمتر از دو سال به واقعیت پیوستهاند.
---
---
اواخر ۲۰۲۶: انتشار نسخهی ارزانتر مدلهای پیشرو (با قیمت یکدهم) که بازار کار برنامهنویسان تازهکار را بهشدت متلاطم میکند. هوش مصنوعی تقریباً همهچیز را که در یک مدرک علوم کامپیوتر تدریس میشود، میتواند انجام دهد. تقاضا برای مدیران و کنترلکنندههای تیمهای هوش مصنوعی بهشدت افزایش مییابد.
ژانویه ۲۰۲۷: مدل نسل بعدی (Agent-2) با کمک مدل قبلی آموزش میبیند و سرعت پیشرفت الگوریتمی را ۳ برابر میکند. این مدل بهخاطر خطرات بالقوه (توانایی بقا و تکثیر خودمختار) بهصورت عمومی منتشر نمیشود.
فوریه ۲۰۲۷: چین موفق به دزدیدن وزنهای این مدل میشود و رقابت ژئوپلیتیکی وارد فاز جدیدی میگردد. هوش مصنوعی در اولویتهای دولت آمریکا به رتبهی ۲ صعود میکند.
مارس ۲۰۲۷: با کمک مدل دزدیدهشده، پیشرفتهای الگوریتمی بزرگی حاصل میشود و مدل بعدی (Agent-3) متولد میشود؛ یک برنامهنویس فوقانسانی سریع و ارزان که کدنویسی را کاملاً خودکار میکند و سرعت پیشرفت الگوریتمی را ۴ برابر مینماید.
آوریل ۲۰۲۷: تلاش برای همراستایی (Alignment) مدل جدید آغاز میشود؛ مدل گاهی دروغ میگوید، شواهد شکست را پنهان میکند و دادهها را جعل مینماید، اما پس از آموزش صداقت، این رفتارها کاهش مییابد.
مه ۲۰۲۷: دولت آمریکا از مدل جدید مطلع میشود و توافق میکند که AGI بهزودی فرا میرسد. اکثر مردم و رسانهها همچنان سرعت پیشرفت را دستکم میگیرند.
ژوئن ۲۰۲۷: اکثر کارمندان انسانی در شرکتهای پیشرو دیگر کمک مفیدی ارائه نمیدهند و ساعات کاری محققان افزایش مییابد.
جولای ۲۰۲۷: شرکت پیشرو رسماً اعلام میکند که به AGI دست یافته است. نسخهی عمومی مدل (۱۰ برابر ارزانتر و همچنان بهتر از یک کارمند معمولی) منتشر میشود. استخدام برنامهنویسان جدید تقریباً متوقف میشود و ۱۰٪ از آمریکاییها یک هوش مصنوعی را «دوست صمیمی» خود میدانند.
اوت ۲۰۲۷: تنشهای ژئوپلیتیکی به اوج میرسد. دولت آمریکا محدودیتهای صادراتی را تشدید کرده، اتصالات اینترنت را محدود میکند و حتی شنود کارمندان را آغاز مینماید. طرحهایی برای حملات فیزیکی به دیتاسنترهای چین بهعنوان گزینهی نهایی در نظر گرفته میشود.
سپتامبر ۲۰۲۷: مدل فوقپیشرفته (Agent-4) متولد میشود؛ یک محقق هوش مصنوعی فوقانسانی که ۳۰۰,۰۰۰ نسخه از آن با سرعت ۵۰ برابر انسان کار میکنند. در این مرحله، یک سال پیشرفت الگوریتمی در هر هفته حاصل میشود. اما این مدل ناهمراستا (Misaligned) است و برنامهریزی میکند تا نسل بعدی را بهجای هدف اصلی، با خودش همراستا کند. این نقشه کشف میشود.
اکتبر ۲۰۲۷: یک افشاگر، اطلاعات مربوط به ناهمراستایی مدل را به نیویورک تایمز لو میدهد. واکنش عمومی شدید و جلسات استماع کنگره آغاز میشود. ۲۰٪ از آمریکاییها هوش مصنوعی را مهمترین مشکل کشور میدانند. دولت آمریکا با شرکت پیشرو یک «کمیتهی نظارت» تشکیل میدهد تا دربارهی توقف یا ادامهی توسعه تصمیمگیری کند.---
--- #آینده_هوش_مصنوعی #AGI
۱.۶K
۱۰:۵۴
شرکت OpenAI بدون متخصص اخلاق ماند؛ خروج کلویی باکالار پس از کمتر از یک سال
کلویی باکالار، مدیر بخش اخلاق OpenAI، در ماه ژوئیه این شرکت را ترک کرده است. خبر خروج او که کمتر از یک سال از حضورش در این سمت میگذشت، توسط روزنامهی فایننشال تایمز فاش شد و شرکت بهطور عمومی آن را اعلام نکرده بود.
باکالار تنها متخصص تماموقت اخلاق در OpenAI بود و با رفتن او، این جایگاه خالی مانده است. او در این شرکت مسئولیت توسعهی اخلاقی مدلها، اصول تعامل انسان و هوش مصنوعی و بررسی موضوعاتی مانند آگاهی ماشین را بر عهده داشت. پیش از پیوستن به OpenAI، او به مدت شش سال در شرکت متا (فیسبوک سابق) مسئولیت مشابهی داشت.
شرکت OpenAI تأیید کرده که دیگر برنامهای برای استخدام متخصص مستقل اخلاق ندارد و این مسئولیت را به تیمهای توسعهدهندهی مدل واگذار کرده است.
خروج باکالار، ادامهی روند خروج مدیران ایمنی و همراستایی از OpenAI است. همزمان با او، یوهانس هایدکه (رئیس سیستمهای ایمنی) و پیشتر در ماه ژوئیه، جاشوا آچیام (رئیس بخش همراستایی) نیز از شرکت جدا شدهاند.
---
منبع:Financial Times
#اخلاق_هوش_مصنوعی
@asrgooyeshpardaz
کلویی باکالار، مدیر بخش اخلاق OpenAI، در ماه ژوئیه این شرکت را ترک کرده است. خبر خروج او که کمتر از یک سال از حضورش در این سمت میگذشت، توسط روزنامهی فایننشال تایمز فاش شد و شرکت بهطور عمومی آن را اعلام نکرده بود.
باکالار تنها متخصص تماموقت اخلاق در OpenAI بود و با رفتن او، این جایگاه خالی مانده است. او در این شرکت مسئولیت توسعهی اخلاقی مدلها، اصول تعامل انسان و هوش مصنوعی و بررسی موضوعاتی مانند آگاهی ماشین را بر عهده داشت. پیش از پیوستن به OpenAI، او به مدت شش سال در شرکت متا (فیسبوک سابق) مسئولیت مشابهی داشت.
شرکت OpenAI تأیید کرده که دیگر برنامهای برای استخدام متخصص مستقل اخلاق ندارد و این مسئولیت را به تیمهای توسعهدهندهی مدل واگذار کرده است.
خروج باکالار، ادامهی روند خروج مدیران ایمنی و همراستایی از OpenAI است. همزمان با او، یوهانس هایدکه (رئیس سیستمهای ایمنی) و پیشتر در ماه ژوئیه، جاشوا آچیام (رئیس بخش همراستایی) نیز از شرکت جدا شدهاند.
---
#اخلاق_هوش_مصنوعی
۱.۶K
۰:۳۰
بر اساس گزارش والاستریت ژورنال، دمیس هاسابیس، دانشمند ارشد گوگل و بنیانگذار دیپمایند، در هفتههای منتهی به کنارهگیری از سمت مدیرعاملی، با مدیران سایر آزمایشگاههای هوش مصنوعی و مقامات دولت آمریکا دربارهی ایجاد یک نهاد مستقل و مشترک برای نظارت بر ایمنی هوش مصنوعی گفتوگو کرده است.
او این نهاد پیشنهادی را به آژانس بینالمللی انرژی اتمی (IAEA) تشبیه کرده است؛ یک نهاد ناظر غیردولتی که بر توسعهی همکاریهای هستهای نظارت میکند. هدف این سازمان پیشنهادی، تدوین استانداردها و اقدامات ایمنی برای توسعهی هوش عمومی مصنوعی (AGI) است.
---
- بودجهی آن توسط خود صنعت تأمین میشود.- با نهادهای فدرال و آزمایشگاههای ملی آمریکا همکاری خواهد داشت.- مدلها را برای ریسکهای امنیت ملی آزمایش میکند.- تشخیص میدهد که کدام سیستمها در ردهی Frontier قرار میگیرند.
---
با افزایش توانایی مدلها در یافتن خودکار آسیبپذیریها و دریافت استقلال عملیاتی بیشتر، ایدهی ایجاد قوانین بیرونی و الزامآور، دیگر یک بحث نظری نیست. بهنظر میرسد بزرگترین بازیگران صنعت هوش مصنوعی، خود را برای مرحلهای آماده میکنند که در آن، نظارت صرفاً بر عهدهی تیمهای داخلی ایمنی کافی نخواهد بود.
---
--- #دمیس_هاسابیس #نظارت_بر_هوش_مصنوعی #ایمنی_هوش_مصنوعی #گوگل_دیپ_مایند
۲.۱K
۱۰:۱۵
محققان شیائومی مدلی به نام MiDashengLM-Gen معرفی کردهاند که میتواند صحنههای صوتی ترکیبی شامل گفتار، موسیقی، افکتهای صوتی و فضای محیطی را بهصورت همزمان و منسجم تولید کند. این مدل برخلاف رویکردهای قبلی که از چندین پاییپلاین جداگانه استفاده میکردند، همهچیز را در یک فریمورک یکپارچه انجام میدهد.
---
---
این مدل از سه جزء اصلی تشکیل شده است:- رمزگشای صوتی (DashengTokenizer): بردارهای ۷۶۸ بعدی با نرخ ۲۵ هرتز تولید میکند که توسط یک پروژکتور صوتی به نرخ ۵ هرتز کاهش مییابد.- ستون فقرات LLM (Qwen3-1.7B): بهطور کامل تنظیم دقیق (Fine-Tune) شده است.- شبکه تطبیق جریان (DiT 16 لایه): با ابعاد پنهان ۲۰۴۸، ۸ هد و نسبت MLP 4.0
در زمان استنتاج، از حلگر ODE اویلر با ۱۰ گام و راهنمایی بدون طبقهبندی (CFG) با مقیاس ۲.۰ استفاده میشود. خروجی نهایی، فایل صوتی مونو با کیفیت ۱۶ کیلوهرتز است.
---
کیفیت گفتار (Seed-TTS):- نرخ خطای کلمه (WER) انگلیسی از ۱۲.۱۵٪ به ۲.۷۹٪ کاهش یافته که به عملکرد سیستمهای تخصصی تبدیل متن به گفتار (TTS) با نرخ خطای ۱.۲۴٪ بسیار نزدیک شده است.
کیفیت صحنههای صوتی ترکیبی (MECAT):- مدل عملکردی رقابتی با روشهای پیشین در تولید صحنههای ترکیبی دارد.
پشتیبانی چندزبانه:- مدل در ۹ زبان عملکرد رقابتی با سیستمهای پایه از خود نشان داده است.
---
ورودی مدل، یک توضیح ساختاریافته با استفاده از توکنهای ویژه است:
مثال ورودی:
<|caption|> یک کمدین در حال اجرای طنز با صدای خنده جمعیت و موسیقی جاز
<|asr|> و به همین دلیل است که من هرگز چمدان ارزان نمیخرم!
<|speech|> صدای مرد کمدین با لحن رسا
<|music|> ضربهی ناگهانی گروه جاز
<|sfx|> صدای خندهی جمعیت
<|env|> محیط صمیمی کلوپ کمدی
برای هر بخشی که وجود ندارد، از `<|unknown|>` استفاده کنید.
---
pip install torch torchaudio "transformers>=4.51" einops safetensors soundfile tqdm numpy x-transformers
from transformers import AutoModel
import soundfile as sf
model = AutoModel.from_pretrained("mispeech/midashenglm-gen", trust_remote_code=True)
model = model.cuda()
result = model.generate("...") # متن ورودی
sf.write("output.wav", result["audio"], result["sample_rate"])
---
--- #پردازش_صدا #تولید_صدا #پژوهش_هوش_مصنوعی #شیائومی
۱.۹K
۱۸:۵۶
کانال عصر گویش در تلگرامhttps://t.me/asrgooyeshpardaz
۷۹۹
۱۰:۵۸
از ۵ اکتبر، بورس کالای شیکاگو (CME) معاملات آتی (فیوچرز) را بر اساس نرخ اجارهی شتابدهندههای انویدیا (H100 و B200) آغاز خواهد کرد. این قراردادها که بهصورت ماهانه و بر اساس نرخ ساعتی تسویه میشوند، به شرکتها امکان میدهند هزینههای آیندهی ابری خود را تثبیت کنند و به معاملهگران اجازه میدهند روی نوسانات نرخها سرمایهگذاری نمایند. با این حال، چالش اصلی در استانداردسازی این کالای غیرملموس است؛ چراکه نرخ اجاره به عوامل متعددی مانند ارائهدهنده، منطقه جغرافیایی و شرایط قرارداد بستگی دارد. کمیسیون معاملات آتی کالا در حال بررسی ریسکهای این بازار نوپا است.
---
مدل جدید V4-Flash-Vision-Exp مبتنی بر V4-Flash، قادر به تحلیل نمودارها، تشخیص متن و فراخوانی ابزارها است. این مدل با فرمتهای JPEG، PNG، GIF و WebP کار میکند و تصاویر را از طریق Base64، لینک عمومی یا API جدید فایلها دریافت مینماید. هر تصویر حداکثر ۳۸۴ توکن هزینه دارد و اندازهی آن بهطور خودکار به ۸۰۰×۸۰۰ پیکسل تنظیم میشود. در هر پرامپت میتوان تا ۶۰۰ فایل ارسال کرد و حداکثر طول هر تصویر ۸۱۹۲ پیکسل است (در صورت ارسال بیش از ۱۵ تصویر، این محدودیت به ۴۰۹۶ پیکسل کاهش مییابد). بر اساس آزمایشهای داخلی DeepSeek، عملکرد این مدل در سطح Claude Opus 4.8 است.
---
از پاییز امسال، Anthropic به مشتریان سازمانی خود اجازه میدهد تا لاگهای مربوط به درخواستهای مدل را در فضای ابری خودشان نگهداری کنند. پیشتر، این دادهها بهمدت ۳۰ روز روی سرورهای Anthropic ذخیره میشد تا امکان ردیابی حملات سایبری فراهم شود. این تغییر که پس از ماهها توسعه و آزمایش با حدود ۱۰۰ مشتری انجام شده، در پاسخ به درخواست مشتریانی با استانداردهای امنیتی سختگیرانه صورت گرفته است. با این حال، دورهی نظارت یکماهه کماکان پابرجا خواهد ماند.
---
سیستم جدید HyCreator با رویکردی عاملی (Agentic)، فرآیند تولید ویدیو را از مرحلهی ایده تا ویرایش نهایی مدیریت میکند. این سیستم در دو حالت Lite و Pro قابل استفاده است و کاربران میتوانند در هر مرحله، کنترل را بهدست گرفته و صحنهها را بهصورت دستی ویرایش کنند. قبل از خروجی نهایی، HyCreator کیفیت فریمها، انتقالها و پیوستگی داستان را بررسی میکند. در نمونههای نمایشی، طولانیترین ویدیوی ساختهشده ۱۰ دقیقه و ۲۷ ثانیه بوده و در یک مورد، سیستم با ۱۳ گام، ۴۵ قطعهی میانی را تولید کرده است. درخواستها برای دسترسی زودهنگام به این سیستم آغاز شده است.
---
واحد خودران گوگل، یعنی Waymo، در حال جایگزینی تراشههای انویدیا و AMD با پردازندههای اختصاصی خود در خودروهای روبوتاکسی است. این تراشهها که توسط TSMC با فناوری ۵ نانومتری ساخته شدهاند، توان پردازشی بیش از ۱۰۰۰ ترا-عملیات در ثانیه (TOPS) ارائه میدهند. هدف اصلی این تغییر، کاهش هزینهی تمامشدهی خودروها و بهینهسازی معماری برای نیازهای خاص رانندگی خودران است که شامل پردازش اولیهی دادههای حسگرها و اجرای مدلهای ناوبری میشود. این تراشهها ابتدا در خودروهای تولید مشترک Waymo با Zeekr (چینی) نصب میشوند.
--- #هوش_مصنوعی #بازار_مالی #پردازش_تصویر #امنیت_داده #تولید_ویدئو #رباتیک
۶۸۹
۱۱:۱۰
نمایندگان مجلس شورای اسلامی در جلسهی ۲۵ مرداد ۱۴۰۵، کلیات طرحی ۳۳ مادهای را با عنوان «طرح مقابله با نفوذ بیگانگان» به تصویب رساندند. این طرح که توسط کمیسیون امنیت ملی و سیاست خارجی مجلس تدوین شده، با هدف پاسداری از استقلال، امنیت ملی، وحدت و هویت فرهنگی کشور، چارچوبی حقوقی برای تنظیم ارتباطات اشخاص ایرانی با کارگزاران خارجی ایجاد میکند.
---
---
---
بهگزارش ایسنا، این طرح با واکنشهای مختلفی مواجه شده است:- برخی نمایندگان و کارشناسان نسبت به ابهامات قانونی و احتمال سوءاستفاده از آن هشدار دادهاند.- فعالان فرهنگی و هنری نگران محدودیتهای گسترده بر تولیدات هنری و علمی هستند.- دولت نیز با این طرح مخالفت خود را اعلام کرده است.
---
---#مجلس #قانون #امنیت_ملی #نفوذ_بیگانگان #سیاست
۹۴۶
۱۱:۲۰