Algorithm design & data structureچ
Photo
click to show
click to show
Photo
click to show
click to show
🔹 آغاز تحول: Vision Transformer (ViT) — سال ۲۰۲۰
تا قبل از سال ۲۰۲۰، بیشتر مدلهای بینایی بر پایهی CNNها بودند؛ مثل ResNet و EfficientNet.
اما در مقالهای از تیم Google Research (Dosovitskiy et al., 2020) ایدهای کاملاً متفاوت مطرح شد:
«اگر تصویر را مثل متن تکهتکه کنیم، میتوانیم از Transformer به جای CNN استفاده کنیم!» 💡
🔸 ایدهی اصلی ViT
📦 در ViT، تصویر به بخشهای کوچک به نام Patch تقسیم میشود (مثلاً 16×16 پیکسل).
هر patch مثل یک “کلمه” در جمله در نظر گرفته میشود.
سپس با Flatten + Linear Projection تبدیل به یک بردار ویژگی میگردد.
🔁 این توکنها (patch embeddings) همراه با Positional Encoding به Encoder ترنسفورمر داده میشوند تا ارتباط میان بخشهای مختلف تصویر را یاد بگیرد.
به زبان ساده:
در واقع Transformer یاد میگیرد که کدام بخشهای تصویر به هم مرتبطاند، بدون نیاز به فیلترهای مکانی CNN.
اطلاع بیشتر:
An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale
#هوش_مصنوعی
📣👨💻 @AlgorithmDesign_DataStructue
35 · 2.2K ·