مثلا یه مورد از اظهار نظر های کسایی که خودشون از هوش مصنوعی دارن درآمد ها عظیم کسب میکنن رو ببین تا بدونی هر چیزی ممکنه
مرجع تخصصی هوش مصنوعی و علم داده
سایت | بله | تلگرام | اینستاگرام
۳۲۵
۱۷:۰۱
داریو آمودی، مدیرعامل Anthropic، اخیراً گفته سرعت پیشرفت مدلهای پیشرفته هوش مصنوعی باید کمتر بشه تا ایمنی و نظارت بتونه خودش رو به این پیشرفت برسونه.
جالب اینجاست که سم آلتمن، مدیرعامل OpenAI، و ایلان ماسک، مدیرعامل xAI، هم با اصل این حرف موافقن.
آمودی میگه AI داره با سرعت زیادی پیشرفت میکنه و بعضی قابلیتها مثل توانایی حمله سایبری یا حتی کمک به ساخت نسل بعدی سیستمهای AI، نگرانیهای جدیدی ایجاد کرده.
۳۹۸
۱۷:۰۲
مدلهای زبانی در اصل متن رو به Tokenهای کوچیکتر تقسیم میکنن.
مثلاً جملهی:«هوش مصنوعی آیندهی برنامهنویسیه»
به مجموعهای از توکنها تبدیل میشه و مدل با توجه به توکنهای قبلی، احتمال توکن بعدی رو پیشبینی میکنه.
یعنی مدل دائماً داره میگه:
اما این فقط بخش سادهی ماجراست؛ اینکه مدل چطور ارتباط بین توکنها رو پیدا میکنه و از Context برای پیشبینی استفاده میکنه، داستان اصلی مدلهای زبانیه.
۳۱۶
۱۵:۳۵
در آموزش مدلهای زبانی و پردازش زبان طبیعی دیتایاد، این مباحث رو از پایه بررسی کردیم؛ از نحوهی پردازش متن و Tokenization گرفته تا ساختار مدلهای زبانی و اینکه مدل چطور از Context برای یادگیری و تولید متن استفاده میکنه.
۴۲۸
۱۵:۳۵
تکنولوژی LightTok؛وقتی خودِ سنسور شروع به پردازش هوش مصنوعی میکنه
پژوهشگران دانشگاه نانجینگ یه تراشه به اسم LightTok ساختن که میتونه بخشی از پردازش موردنیاز مدلهای بینایی رو همون داخل سنسور انجام بده.
یعنی بهجای اینکه اول تصویر کامل ثبت بشه، بعد کلی داده جابهجا بشه و تازه پردازش شروع بشه، سنسور از همون ابتدا اطلاعات نوری رو به شکل مناسب برای Vision Transformer آماده میکنه.
نمونه اولیه فعلاً فقط ۳۲×۳۲ پیکسله، اما ایدهش خیلی جالبه.
مرجع تخصصی هوش مصنوعی و علم داده
سایت | بله | تلگرام | اینستاگرام
پژوهشگران دانشگاه نانجینگ یه تراشه به اسم LightTok ساختن که میتونه بخشی از پردازش موردنیاز مدلهای بینایی رو همون داخل سنسور انجام بده.
یعنی بهجای اینکه اول تصویر کامل ثبت بشه، بعد کلی داده جابهجا بشه و تازه پردازش شروع بشه، سنسور از همون ابتدا اطلاعات نوری رو به شکل مناسب برای Vision Transformer آماده میکنه.
نمونه اولیه فعلاً فقط ۳۲×۳۲ پیکسله، اما ایدهش خیلی جالبه.
۲۵۷
۱۱:۵۳
در دوربینهای معمولی، اول نور به تصویر دیجیتال تبدیل میشه. بعد این تصویر باید به پردازنده منتقل بشه تا برای مدل هوش مصنوعی آماده بشه.
LightTok سعی میکنه بخشی از این پردازش رو همون داخل سنسور انجام بده.
یعنی سنسور فقط تصویر رو ثبت نمیکنه، بلکه همونجا بخشی از اطلاعات تصویر رو به شکلی آماده میکنه که برای مدلهایی مثل Vision Transformer قابل استفاده باشه.
به این ایده میگن Physical Tokenizer.
مزیتش هم اینه که داده کمتری نیاز به جابهجایی داره و در نتیجه میتونه مصرف انرژی رو کاهش بده.
۲۷۷
۱۱:۵۳
آخرین آپدیت دوره بینایی کامپیوتر ما در مورد Vision Transformer بود که اینجا بهش اشاره شده.
مرجع تخصصی هوش مصنوعی و علم داده
سایت | بله | تلگرام | اینستاگرام
۳۵۲
۱۱:۵۳
Transformer فقط برای متن نیست!
در ViT، تصویر به تکههای کوچیکتر یا Patch تقسیم میشه.
مثلاً تصویر 224×224 با Patchهای 16×16، تبدیل میشه به 196 Patch.
هر Patch تقریباً مثل یک Token در متن در نظر گرفته میشه.
#آموزشی
۲۰۱
۱۱:۵۱
🧩 بعد از تقسیم تصویر، هر Patch به یک بردار عددی تبدیل میشه.
اما یک مشکل وجود داره:
Transformer نمیدونه هر Patch کجای تصویر بوده.
برای همین از Positional Embedding استفاده میکنیم تا موقعیت هر Patch هم به مدل منتقل بشه.
مرجع تخصصی هوش مصنوعی و علم داده
سایت | بله | تلگرام | اینستاگرام
اما یک مشکل وجود داره:
Transformer نمیدونه هر Patch کجای تصویر بوده.
برای همین از Positional Embedding استفاده میکنیم تا موقعیت هر Patch هم به مدل منتقل بشه.
۲۳۸
۱۱:۵۱
با استفاده از Self-Attention، مدل میتونه ارتباط بین Patchهای مختلف تصویر رو بررسی کنه.
مثلاً برای تشخیص گربه، ارتباط بین Patchهای مربوط به چشم، گوش و بدن رو بررسی میکنه.
۲۳۹
۱۱:۵۱