خانه هوش ایران
خانه هوش ایران

کارشناس ارشد بینایی کامپیوتر (AI)

تهران، میدان ولیعصر
تمام وقت
حضوری 8 الی 16
-
-

این فرصت شغلی چقدر برای من مناسب است؟

11 تا 50 نفر
تکنولوژی و نوآوری / سرمایه گذاری خطرپذیر / شتاب دهنده
توضیحات بیشتر

شاخص های کلیدی از نظر کارفرما

4 سال سابقه کار در گروه شغلی مشابه
کارشناسی کامپیوتر / فناوری اطلاعات
Python - متوسط
OpenCV - مقدماتی

شرح شغل و وظایف

استان / شهر: تهران - تهران
نوع همکاری: تمام‌وقت
حداقل حقوق: توافقی

شرح شغل / مسئولیت‌ها:
طراحی و پیاده‌سازی چرخه کامل داده برای آموزش یک Foundation Document Model به‌صورت end-to-end روی اسناد متنوع.
ساخت مجموعه‌داده‌های ساخت‌یافته، متنوع و باکیفیت همراه با test set و بنچمارک‌های استاندارد برای ارزیابی مدل‌های end-to-end روی سناریوهای واقعی.

شرح وظایف
1) شناسایی و جمع‌آوری داده
شناسایی، جمع‌آوری و سازماندهی انواع داده‌های سندمحور از منابع مختلف.
مستندسازی دقیق منبع داده، شرایط ثبت (زاویه، نور، دستگاه) و متادیتا برای استفاده در تحلیل و بنچمارک.

2) طراحی ساختار دیتاست، دسته‌بندی و برچسب‌زنی
تعریف اسکیما و طبقه‌بندی داده‌ها بر اساس:
نوع محیط (Classroom, Meeting Room, Conference Hall, etc.)
نوع سطح نوشتار (Whiteboard, Glass Board, Flip Chart, Screen, Paper, …)
نوع منبع (Camera, Scanner, Screen Capture)
سطح پیچیدگی و میزان شلوغی صحنه (text density, clutter, occlusion).
طراحی استراتژی برچسب‌زنی برای مدل‌های end-to-end:
برچسب‌های ساختاری: بلاک‌های متن، تیتر، جدول، شکل، ناحیه تخته، ناحیه اسلاید.
برچسب‌های معنایی: نوع محتوا، عنوان اسلاید، متن آموزشی، فرمول، نمودار، (bullet list).
برچسب‌های چندلایه مشابه دیتاست‌هایی مثل HierText و سایر دیتاست‌های Google Research (برای الهام از ساختار، نه کپی).
طراحی فرمت‌های annotation مناسب برای مدل‌های end-to-end به‌جای فقط bounding box ساده.
انتخاب، ارزیابی و مدیریت ابزارهای برچسب‌زنی: Label Studio، CVAT، ابزارهای داخلی و …
طراحی guideline دقیق برای annotatorها (نحوه برچسب‌زنی تخته، اسلاید، مانیتور، متن دست‌نویس/چاپی و عناصر حاشیه‌ای) و سناریوهای چندمنبعی (whiteboard + projector + display).

3) طراحی بنچمارک و test set
طراحی test setهای تخصصی برای سنجش توان مدل.
تعریف پروتکل بنچمارک و متریک‌ها برای ارزیابی end-to-end از تصویر تا خروجی ساختاریافته.
تفکیک بنچمارک بر اساس domain (Classroom / Meeting / Mixed).
طراحی split حرفه‌ای (train / val / test) با رعایت diversity و جلوگیری از shortcut learning (مثلاً عدم وابستگی به ویژگی‌های سطحی مانند فقط رنگ پس‌زمینه یا نوع دستگاه).
هم‌تراز کردن ساختار بنچمارک با دیتاست‌های معتبر متن-در-تصویر و اسناد برای امکان مقایسه علمی در آینده.

4) کنترل کیفیت، فیلترینگ و پردازش تصویر
طراحی و پیاده‌سازی pipeline پردازش تصویر برای پاک‌سازی و استانداردسازی داده‌ها (resize، normalizing، cropping هوشمند، حذف نویز شدید).
اعمال فیلترینگ بر اساس معیارهای تصویر (blur، exposure، compression artifacts).
پیاده‌سازی و تست فیلترهای تصویری و تکنیک‌های گرافیک کامپیوتری برای بهبود کیفیت یا شبیه‌سازی شرایط واقعی (noise، motion blur، perspective distortion).
استفاده از معیارهای کمی برای انتخاب داده‌های باارزش (diversity، sample complexity) و اجتناب از bias.
طراحی استراتژی جلوگیری از shortcut learning.
پیشنهاد و پیاده‌سازی augmentation معنادار برای سناریوهای واقعی (reflection روی مانیتور، نور پروژکتور، سایه نفرات، لکه روی تخته، دست‌نویس نامنظم و …).

5) شناخت بنچمارک‌ها و مدل‌های end-to-end
آشنایی عمیق با بنچمارک‌ها و دیتاست‌های مرجع (دیتاست‌های چندسطحی و اسناد پیچیده).
شناخت معماری‌ها و رویکردهای end-to-end (از «تصویر تا layout + متن + ساختار»).
درک رابطه نوع annotation با نوع مدل (two-stage vs end-to-end).
کمک به طراحی بنچمارک داخلی برای سنجش Foundation Document Model در مقابل استانداردها.

6) همکاری بین‌تیمی و مستندسازی
همکاری نزدیک با تیم تحقیق (Model / Algorithm) برای هم‌راستا کردن نیازهای داده با طراحی معماری.
همکاری با تیم مهندسی (MLOps / Data Engineer) برای پیاده‌سازی پایپ‌لاین‌های مقیاس‌پذیر.
مستندسازی کامل guideline برچسب‌زنی، طراحی بنچمارک، splitها و متریک‌ها، نسخه‌بندی دیتاست‌ها و تغییرات آن‌ها در طول زمان.

مهارت‌های فنی ضروری (Must-have)
تسلط خوب روی Python برای اسکریپت‌نویسی پردازش تصویر و مدیریت داده.
تسلط بر مباحث آمار و احتمالات، جبر خطی و هندسه ترسیمی.
آشنایی عملی با پردازش تصویر و کار با کتابخانه‌هایی مانند OpenCV (یا مشابه) و مفاهیم blur، sharpening، thresholding، edge detection و …
درک مفاهیم پایه‌ای گرافیک کامپیوتری: transformهای هندسی (rotation, perspective, homography) و مفاهیم display، projection، رزولوشن، aspect ratio.
شناخت مفاهیم کلیدی یادگیری عمیق برای مدل‌های end-to-end (نقش diversity در generalization).
آشنایی با augmentation و توانایی طراحی augmentation مسئله‌محور.
آشنایی با بنچمارک‌ها و دیتاست‌های مهم در حوزه scene text / document understanding و ساختار دیتاست‌های بزرگ و شکل annotation آن‌ها.
تجربه عملی با ابزارهای برچسب‌زنی (حداقل یک ابزار حرفه‌ای مثل CVAT یا Label Studio یا مشابه).
توانایی تعریف template و guideline برای annotatorها.
توانایی طراحی و مدیریت test set (splitهای منطقی، سناریوهای edge-case و طراحی بنچمارک برای end-to-end).

مهارت‌های ترجیحی (Nice-to-have)
آشنایی با معماری‌های OCR، scene text detection/recognition و مدل‌های Document Foundation / VLM.
تجربه کار با دیتاست‌های public در حوزه اسناد و متن در تصویر.
آشنایی با مفاهیم research (پروتکل آزمایش، ablation study، تحلیل خطا).
تجربه کار در تیم‌های تحقیقاتی یا محصول‌محور مرتبط با بینایی کامپیوتر یا NLP.

مهارت‌های نرم (Soft Skills)
دقت بالا در جزئیات و حساسیت نسبت به کیفیت annotation.
توانایی فکر کردن سیستمی و طراحی فرایند.
مهارت مستندسازی روشن و منظم.

شرایط احراز شغل

جنسیت
تفاوتی ندارد
تحصیلات
کارشناسی| کامپیوتر / فناوری اطلاعات
نرم افزارها
Python| متوسط OpenCV| مقدماتی

ثبت مشکل و تخلف آگهی

ارسال رزومه برای خانه هوش ایران