سلام، علاقه مندان به فناوری و خودی های صنعت! امروز قصد دارم عمیقاً در دنیای مدلهای ترانسفورماتور غوطه ور شوم و در مورد تفاوتهای بین مدلهای ترانسفورماتور اتورگرسیو و غیرخودرگرسیو صحبت کنم. به عنوان یک تامین کننده ترانسفورماتور، من از نزدیک دیدم که چگونه این مدل ها آینده هوش مصنوعی و یادگیری ماشین را شکل می دهند. بنابراین، بیایید شروع کنیم!
مدل های ترانسفورماتور اتورگرسیو
مدلهای ترانسفورماتور اتورگرسیو از معروفترین مدلها در فضای هوش مصنوعی هستند. شاید در مورد غول هایی مانند GPT (ترانسفورماتور از پیش آموزش داده شده تولیدی) شنیده باشید که در این دسته قرار می گیرند. ایده اصلی پشت مدلهای اتورگرسیو این است که آنها خروجی یک توکن را بر اساس توکنهای قبلی تولید میکنند.
مانند گفتن یک داستان یک کلمه در یک زمان به آن فکر کنید. هر کلمه جدید به تمام کلمات قبل از آن بستگی دارد. در مفهوم ریاضی، اگر دنباله ای از نشانه ها (y_1,y_2,\cdots,y_n) داشته باشیم، یک مدل خودرگرسیون (y_i) مشروط به (y_1,y_2,\cdots,y_{i - 1}) را پیش بینی می کند. بنابراین، (P(y_1,y_2,\cdots,y_n)=\prod_{i = 1}^{n}P(y_i|y_1,y_2,\cdots,y_{i-1})).
یکی از مزیتهای بزرگ مدلهای اتورگرسیو، توانایی آنها در تولید توالیهای بسیار منسجم و متنی - غنی است. از آنجایی که هر توکن بر اساس تاریخچه کامل توکن های قبلی تولید می شود، خروجی تمایل دارد به خوبی جریان داشته باشد و در زمینه داده شده معنا پیدا کند. به عنوان مثال، در وظایف تولید زبان، متن تولید شده توسط مدلهای اتورگرسیو اغلب طوری خوانده میشود که گویی توسط یک انسان نوشته شده است.
با این حال، برخی از اشکالات نیز وجود دارد. ماهیت متوالی تولید خروجی به این معنی است که مدلهای اتورگرسیو میتوانند بسیار کند باشند، بهویژه وقتی با دنبالههای طولانی سروکار دارند. هر توکن جدید باید منتظر باشد تا توکنهای قبلی تولید شوند و در فرآیند تولید یک گلوگاه ایجاد شود.
اگر به راه حل های مبتنی بر اتورگرسیو برای برنامه های خاص علاقه دارید، می توانید آن را بررسی کنیدترانسفورماتور غوطه ورکه عملکرد قابل اعتمادی را در طیف وسیعی از زمینه ها ارائه می دهد.
مدل های ترانسفورماتور غیر خودرگرسیون
از سوی دیگر، مدلهای ترانسفورماتور غیر اتورگرسیو رویکرد متفاوتی دارند. به جای اینکه توکن ها را یکی یکی تولید کنند، سعی می کنند کل دنباله خروجی را به صورت موازی تولید کنند. این مانند نوشتن یک داستان یکباره است نه کلمه به کلمه.
مدلهای غیر خودرگرسیون مستقیماً همه نشانهها را در دنباله خروجی بر اساس ورودی پیشبینی میکنند. به عنوان مثال، در یک کار ترجمه ماشینی، به جای ترجمه کلمه به کلمه جمله به صورت متوالی، یک مدل غیر خودرگرسیون کل جمله ورودی را تجزیه و تحلیل می کند و سپس جمله ترجمه شده را به یکباره خروجی می دهد.
مزیت اصلی مدل های غیر اتورگرسیو سرعت آنهاست. از آنجایی که آنها کل دنباله را به صورت موازی تولید می کنند، می توانند بسیار سریعتر از مدل های اتورگرسیو باشند، به خصوص برای دنباله های طولانی. این باعث میشود که آنها برای برنامههایی که در آنها تولید در زمان واقعی یا با سرعت بالا مورد نیاز است، مانند زیرنویس زنده، انتخابی عالی باشند.
اما مدل های غیر خودرگرسیون نیز با چالش هایی روبرو هستند. ایجاد توالیهای منسجم میتواند دشوارتر باشد، زیرا با در نظر گرفتن زمینه در هر مرحله، مزیت ساخت نشانههای خروجی به توکن را ندارند. گاهی اوقات خروجی ممکن است فاقد نرمی و زمینه - آگاهی باشد که مدل های خودرگرسیون می توانند به آن دست یابند.
برای راه حل های غیر خودرگرسیو با سرعت بالا و کارآمد،ترانسفورماتور نصب شده بر روی پد نوع خشکیک گزینه عالی برای نیازهای مختلف صنعتی است.
تفاوت های کلیدی در آموزش و استنتاج
وقتی نوبت به آموزش میرسد، مدلهای اتورگرسیو برای به حداکثر رساندن احتمال توکن بعدی با توجه به توکنهای قبلی آموزش داده میشوند. تابع ضرر معمولاً از دست دادن آنتروپی متقابل بر روی تمام نشانههای دنباله محاسبه میشود. این فرآیند آموزشی به طور موثر به مدل می آموزد که محتمل ترین نشانه بعدی را در هر مرحله پیش بینی کند.
با این حال، مدلهای غیر خودرگرسیون اغلب برای به حداقل رساندن نوع متفاوتی از اتلاف آموزش داده میشوند، مانند فاصله ویرایش یا میانگین مربعات خطا بین دنباله پیشبینیشده و دنباله هدف. هدف این است که کل سکانس پیش بینی شده را تا حد امکان به دنباله صحیح در یک عکس نزدیک کنید.


از نظر استنتاج، همانطور که قبلاً بحث کردیم، مدلهای اتورگرسیو فرآیند استنتاج متوالی دارند. آنها از ابتدای دنباله خروجی شروع می کنند و هر توکن را یکی پس از دیگری تولید می کنند. این می تواند یک فرآیند زمان بر باشد، به خصوص برای خروجی های طولانی.
در مقابل، مدلهای غیر خودرگرسیو استنتاج را در یک پاس انجام میدهند. آنها ورودی را می گیرند، پردازش می کنند و مستقیماً کل دنباله خروجی را تولید می کنند. این منجر به زمانهای استنتاج بسیار سریعتر میشود، تا زمانی که مدل بتواند نتایج منسجمی ایجاد کند.
عملکرد در وظایف مختلف
در کارهای تولید زبان مانند خلاصهسازی متن و داستاننویسی، مدلهای اتورگرسیو معمولاً از نظر کیفیت متن تولید شده بهتر عمل میکنند. فرآیند تولید متوالی آنها به آنها امکان می دهد زمینه ایجاد کنند و متنی طبیعی و روان تر تولید کنند. به عنوان مثال، هنگام تولید یک خلاصه مقاله خبری، یک مدل اتورگرسیو می تواند خلاصه ای ایجاد کند که مانند یک متن خوب نوشته شده باشد.
از طرف دیگر، مدلهای غیر خودرگرسیو برای کارهایی که سرعت در آنها بسیار مهم است، مناسبتر هستند. در ترجمه ماشینی، به ویژه برای ترجمه اسناد طولانی، مدل های غیر خودرگرسیون می توانند ترجمه های سریعی را ارائه دهند. اگرچه ممکن است ترجمه ها به اندازه ترجمه های مدل های اتورگرسیو صیقلی نباشند، اما همچنان می توانند برای بسیاری از اهداف عملی به اندازه کافی دقیق باشند.
در تشخیص گفتار، مدلهای اتورگرسیو میتوانند پیشبینیهای خود را با «شنیدن» بیشتر سیگنال گفتار تنظیم کنند. این به این دلیل است که آنها رونویسی را یک کلمه در یک زمان تولید می کنند و می توانند کلمات قبلی را در نظر بگیرند. مدلهای غیر خودرگرسیون میتوانند به سرعت گفتار را رونویسی کنند، اما در مواردی که زمینه بسیار مهم است، ممکن است با مشکل مواجه شوند.
کدام یک را انتخاب کنیم؟
انتخاب بین مدل های ترانسفورماتور اتورگرسیو و غیر اتورگرسیو واقعاً به نیازهای خاص شما بستگی دارد. اگر کیفیت خروجی تولید شده را در اولویت قرار دهید و دنباله باید بسیار منسجم و متن - غنی باشد، احتمالاً یک مدل اتورگرسیو راه حلی است. با این حال، اگر سرعت نگرانی اصلی شما است و می توانید برخی از سازش ها را در کیفیت خروجی تحمل کنید، یک مدل غیر خودرگرسیون ممکن است مناسب تر باشد.
به عنوان یک تامین کننده ترانسفورماتور، ما طیف گسترده ای از راه حل ها را بر اساس هر دو مدل اتورگرسیو و غیر خودرگرسیو ارائه می دهیم. چه در حال کار بر روی یک پروژه تحقیقاتی، یک برنامه تجاری یا یک کار صنعتی باشید، ما می توانیم به شما کمک کنیم تا ترانسفورماتور مناسب را پیدا کنید که مطابق با نیازهای شما باشد.
اگر علاقه مند به بحث در مورد نیازهای خاص خود و بررسی بهترین مدل های ترانسفورماتور برای پروژه خود هستید، در تماس با آنها درنگ نکنید. ما اینجا هستیم تا به شما در مورد تمام سوالات مربوط به Transformer کمک کنیم و به شما کمک کنیم آگاهانه ترین تصمیم را بگیرید. بیایید در مورد اینکه چگونه میتوانیم پروژه شما را با جدیدترین و بهترین فناوری ترانسفورماتور پیش ببریم، صحبت کنیم!
مراجع
- Vaswani، A.، Shazeer، N.، Parmar، N.، Uszkoreit، J.، Jones، L.، Gomez، AN، ... و Polosukhin، I. (2017). توجه تنها چیزی است که نیاز دارید. پیشرفت در سیستم های پردازش اطلاعات عصبی
- Gu, J., Bradbury, J., Xiong, C., & Socher, R. (2018). ترجمه ماشین عصبی غیر خودرگرسیون. پیش چاپ arXiv arXiv:1711.02281.
- رادفورد، ا.، نراسیمهان، ک.، سالیمانز، تی، و سوتسکور، آی. (2018). بهبود درک زبان با پیش آموزش مولد.
