זיהוי אובייקטים בתמונות פנורמה גדולות
תמונות פנורמיות הופכות לפופולריות יותר ויותר בעולם של ימינו, במיוחד כאשר חוקרים ערים באמצעות כלים כמו Google Street View. עם ההתפתחות המהירה של טכניקות ראייה ממוחשבת, ניתן כעת לבנות מודלים מתקדמים לזיהוי אובייקטים בתמונות פנורמיות, שיסייעו לזהות ולאתר אובייקטים שונים בהן.
במאמר זה נבחן כיצד לבנות מודלים של ראייה ממוחשבת לזיהוי אובייקטים בתמונות פנורמיות באמצעות מסגרת SAHI (Slicing Aided Hyper Inference) ונ� discut דוגמאות ליישומים שבהם ניתן להשתמש במודלים כאלה. נתמקד בזיהוי וגילוי של תמרורי תנועה ותכונות אחרות של תשתית רשת הכבישים.
האתגרים בעבודה עם תמונות פנורמיות
תמונות פנורמיות של ערים, כמו ב-Google Street View, מציבות אתגרים ייחודיים בעת בניית מודלים לזיהוי ואיתור אובייקטים. אחד האתגרים המשמעותיים ביותר הוא הגודל הרב של התמונות. תמונות אלו יכולות להיות ברוחב של אלפי פיקסלים, מה שמקשה על עיבודן ביעילות.
אתגר נוסף הכרוך בבניית מודלים של ראייה ממוחשבת לזיהוי אובייקטים עבור תמונות פנורמיות הוא גודלו הקטן של האובייקט ביחס לרזולוציית התמונה הכוללת. במקרים מסוימים, האובייקטים בתמונות הפנורמיות יכולים להיות פחות מ-0.1% משטח התמונה כולו, מה שהופך אותם לקשים מאוד לזיהוי, לזיהוי ולהערכה.
כאשר האובייקטים קטנים, רזולוציית התמונות עשויה שלא להיות גבוהה מספיק כדי לספק את רמת הפירוט הנדרשת לזיהוי אובייקטים או סיווג תמונות מדויק. בנוסף, הגודל הקטן של האובייקטים יכול להקשות על ההבחנה בינם לבין הרקע של התמונה, מה שיכול לסבך עוד יותר את הליך הזיהוי. ניתוח אזורי תמונה ספציפיים יכול לסייע בבידוד וזיהוי אובייקטים קטנים מרקעים מורכבים, ולשפר את דיוק הזיהוי.
מודלים של ראייה ממוחשבת לזיהוי אובייקטים
בניית מודלים לזיהוי אובייקטים בתמונות פנורמיות מחייבת מספר שלבים מרכזיים. תחילה, היינו צריכים להשיג מערך נתונים של תמונות פנורמיות שבאמצעותו אימנו את המודל שלנו.
הכנת נתונים וסיווג תמונות
הכנת נתונים היא שלב מכריע בבניית מודל זיהוי אובייקטים מדויק ואפקטיבי עבור תמונות פנורמיות. הדבר כרוך באיסוף ותיוג של סט גדול של תמונות פנורמיות שישמשו לאימון מודל זיהוי האובייקטים. במקרה הספציפי הזה, כמה מאות תמונות פנורמיות תויגו ידנית עם תמרורי תנועה, רמזורים, ברזי כיבוי אש, מאפייני תשתית כבישים ותוויות רלוונטיות נוספות.
תיוג תמונות באופן ידני הוא טכניקה שגוזלת זמן, אך הכרחית לאימון מודל זיהוי אובייקטים מדויק. תיוג כל אובייקט בתמונה מאפשר למודל לזהות ולסווג כל אובייקט בדיוק כאשר הוא נחשף לתמונות חדשות. בנוסף, הנתונים המתויגים מאפשרים למודל לסווג תמונות על ידי שיוכן לקטגוריות מוגדרות מראש בהתבסס על האובייקטים הקיימים בהן.
מספר נתונים סטטיסטיים על תמונות ותיבות תוחמות עבור מערך הנתונים שלנו:
- ערכת אימון:
- 500 תמונות פנורמה
- 1998 הערות תיבה תוחמת
- ערכת בדיקה:
- 250 תמונות פנורמה
- 1045 הערות תיבה תוחמת
מערכי הנתונים היו מאוד לא מאוזנים, כפי שניתן לראות באיורים שלהלן. ניתן לראות רק 29 מופעים של תמרורי הגבלת מהירות במערך נתוני האימון. בנוסף, למעלה מ-80% מתיבות התיחום היו קטנות מ-50×50 פיקסלים. זוהי סביבה מאתגרת מאוד עבור כל גלאי האובייקטים.



מערכי הנתונים היו מאוד לא מאוזנים, כפי שניתן לראות באיורים שלהלן. ניתן לראות רק 29 מופעים של תמרורי הגבלת מהירות במערך נתוני האימון. בנוסף, למעלה מ-80% מתיבות התיחום היו קטנות מ-50×50 פיקסלים. זוהי סביבה מאתגרת מאוד עבור כל גלאי האובייקטים.
כפי שניתן לראות, זה היה מדגם קטן מאוד של נתונים – בדרך כלל אנו מתמודדים עם אלפי או אפילו מאות אלפי תמונות. עם זאת, בהתחשב בגודלם הגדול של הפנורמות ובגודלם הקטן מאוד של האובייקטים שתייגנו, נדרשו למעלה מ-3 ימי עבודה לתייג 750 התמונות הללו.
עבור מודלים של ייצור בקנה מידה גדול, כאשר יש לתייג אלפי או מיליוני תמונות, אנו ממליצים להאיץ תהליך זה באמצעות transfer learning ואיטרציות מהירות.
כדי ללמוד עוד על תיוג נתונים אוטומטי, סיווג תמונות וסגמנטציה של מופעים, עיינו במאמר שלנו. >>
מודל ממשפחת YOLO
במקרה שלנו, בחרנו להשתמש במשפחת המודלים YOLO. YOLO היא משפחת מודלים לזיהוי אובייקטים שצברה פופולריות לאחרונה. כמודלים של למידה עמוקה ורשתות למידה עמוקה, YOLO ווואריאציות שלה נמצאים בשימוש נרחב במשימות זיהוי אובייקטים. YOLO הוא ראשי תיבות של "You Only Look Once". השתמשנו ב-YOLOX, שהוא שדרוג של מודל YOLO המקורי. YOLOX מבוסס על ארכיטקטורת רשת עצבית קונבולוציונית והוא סוג של רשת עצבית המותאמת במיוחד לזיהוי אובייקטים. YOLOX ידוע בביצועיו המהירים אך המדויקים, מה שהופך אותו למתאים במיוחד לזיהוי אובייקטים בתצלומים פנורמיים.
אחד היתרונות המרכזיים של YOLOX הוא היכולת שלו להשיג דיוק גבוה תוך שמירה על זמני הסקה מהירים (מהיר יותר מ-EfficientDet). הדבר מושג באמצעות מספר אופטימיזציות, כגון זיהוי אובייקטים ללא עוגנים (anchor-free), חילוץ תכונות משופר ושימוש יעיל יותר בזיכרון. YOLOX מעבד מפות תכונות בקני מידה מרובים כדי לאפשר זיהוי רב-קני מידה.

באופן כולל, גלאי האובייקטים YOLOX מתאים היטב לשימוש בתמונות פנורמיות והוכח כמשיג ביצועים מתקדמים במגוון משימות ראייה ממוחשבת לזיהוי אובייקטים. YOLOX הוא אחד מכמה מודלים לזיהוי אובייקטים, וקיימות שיטות שונות לזיהוי אובייקטים בתחום. המהירות והדיוק שלו הופכים אותו לבחירה פופולרית למגוון יישומים בעולם האמיתי, מרכבים אוטונומיים ועד מערכות מעקב. YOLOX מבצע גם סיווג אובייקטים וגם לוקליזציה של אובייקטים במעבר אחד. הוא יכול להתמודד עם מחלקות מרובות ומבצע דיסקרטיזציה של מרחב הפלט לזיהוי יעיל.
מסגרת SAHI לאימון ראייה ממוחשבת
גישה אחת לאימון מודלים לזיהוי אובייקטים עבור תמונות פנורמיות שהניבה לנו תוצאות מצוינות היא מסגרת Sliced Aided Hyper Inference (SAHI). במקרה שלנו, SAHI כלל פיצול התמונות לטלאים חופפים ואימון מודלי זיהוי אובייקטים על אותם טלאים. לאחר האימון, המודל משמש לביצוע חיזוי על תמונות שלמות באמצעות הסקה מחולקת.
המושג sliced inference הוא מרכזי במסגרת SAHI. בעיקרו של דבר, sliced inference כולל ביצוע הסקת זיהוי אובייקטים על פרוסות קטנות יותר של התמונה הפנורמית המקורית, ולאחר מכן מיזוג התחזיות המפולחות כדי ליצור פלט זיהוי אובייקטים מלא עבור התמונה המקורית. התהליך מומחש להלן:

על ידי פיצול התמונה הפנורמית לפרוסות קטנות יותר ואימון עליהן, מודל זיהוי האובייקטים יכול להתמודד בקלות רבה יותר עם האתגרים של גודל תמונה גדול וגודל אובייקט קטן, הנפוצים בעבודה עם תמונות פנורמיות. בנוסף, מסגרת SAHI מספקת מנגנון לאיחוד התחזיות שנוצרות על ידי המודל על הפרוסות הבודדות, וכתוצאה מכך מתקבל פלט זיהוי אובייקטים מדויק ומקיף יותר עבור התמונה הפנורמית כולה.
השימוש ב-SAHI קל כמו ייבוא שלו וקריאה לפונקציה אחת תוך מתן מפרט המודל המאומן שלנו ונתיב לנתונים. מסגרת SAHI מטפלת בשאר, והתוצאות נשמרות בספרייה לבחירתנו. קטע קוד לדוגמה מוצג להלן.
from sahi.predict import predict predict( model_type="mmdet", model_path="path/to/model/file.pth", model_config_path="path/to/model/config.py", model_device="cuda:0", model_confidence_threshold=0.25, slice_height=512, slice_width=512, overlap_height_ratio=0.2, overlap_width_ratio=0.2, source="test-images", project="test-images-predictions" )
דוגמה לחיזוי ניתן לראות להלן. שימו לב שאפילו תמרורי תנועה קטנים מאוד ברקע מזוהים ברמת ביטחון גבוהה.
בסך הכול, מסגרת SAHI הוכיחה את עצמה כגישה יעילה לאימון מודלים לזיהוי אובייקטים בתצלומים פנורמיים, ומאפשרת שיפור בדיוק בהשוואה לטכניקות מסורתיות לזיהוי אובייקטים.
חלופות ל-SAHI
כמה גישות חלופיות לזיהוי אובייקטים בתמונות בקנה מידה גדול כוללות:
- שינוי גודל תמונה: בגישה זו, תמונת הקלט משונה לגודל קטן יותר לפני עיבודה על ידי אלגוריתם זיהוי האובייקטים. הדבר יכול להפחית את המורכבות החישובית של האלגוריתם, אך הוא עלול גם לגרום לדיוק נמוך יותר, במיוחד עבור אובייקטים קטנים.
- גישות מבוססות אזורים: בגישה זו, התמונה מפולחת תחילה לאזורי עניין, ואלגוריתם זיהוי האובייקטים מוחל על כל אזור בנפרד. זו יכולה להיות דרך יעילה להפחית את המורכבות החישובית של האלגוריתם, אך היא עלולה גם לגרום לפספוסים בזיהוי אם אזורי העניין אינם מוגדרים כראוי.
- ארכיטקטורות זיהוי אובייקטים מתמחות: גלאי ירייה בודדת עם מיזוג תכונות (FFSSD), Multi-scale Deconvolutional Single Shot Detector (MDSSD) or QueryDet ניתן להשתמש בהם, אולם גישות אלו אינן מיינסטרים ובדרך כלל דורשות השקעות גבוהות הן במחקר של ממצאי המאמר והן בשחזור ואימון מחדש של הרשת.
במקרה שלנו, לא רצינו להתפשר בין דיוק המודל לקושי היישום, ולכן בחרנו להשתמש ב-SAHI למטרותינו.
מגבלות SAHI עבור מודלים לזיהוי אובייקטים
למרות שמסגרת SAHI הוכחה כגישה יעילה לאימון מודלים לזיהוי אובייקטים בתצלומים פנורמיים, יש לה מספר מגבלות. אחד האתגרים העיקריים בשימוש ב-SAHI הוא זמן ההסקה המוגבר וכוח החישוב הנדרש בשל הצורך לטפל במספר טלאי תמונה ולמזג את התחזיות המתקבלות.
ניתן לנקוט מספר אסטרטגיות אפשריות כדי למתן את הדרישות המוגברות של מהירות ההסקה וכוח החישוב של SAHI. גישה אחת היא להגביל את החלק של התמונה המעובד על ידי מודל זיהוי האובייקטים.
לדוגמה, הסרת 25% התחתונים וה-25% העליונים של התמונה מפחיתה את מספר הקטעים הנדרשים ליצירת תחזיות טובות. הסרת חלקים אלה של התמונה מוצדקת במקרה שלנו, שכן החלק העליון והתחתון של תמונת הפנורמה מכילים בדרך כלל את השמיים ואת פני הכביש, בהתאמה. העיוותים הרבים ביותר, בשל אפקט העין הדגית, מתרחשים גם באזורים אלה. על ידי הכללת קטעים מאזורים אלה, אנו רק מבזבזים חישוב, שכן המודל אינו יכול לזהות ריהוט כביש ביעילות – מה שגורם למספר גדול יותר של תוצאות חיוביות שגויות.
אסטרטגיה נוספת היא לייעל את מסגרת SAHI כדי לשפר את היעילות שלה. הדבר יכול לכלול ייעול של מודל זיהוי האובייקטים עצמו, כמו גם את שלבי העיבוד המאוחר המשמשים לחיבור התחזיות שהמודל מייצר על חלקי התמונה הבודדים (יישום SAHI הנוכחי משתמש בעיבוד חלקים עוקב במקום בעיבוד באצוות).
בנוסף, התקדמויות בחומרה, כגון שימוש ביחידות עיבוד ייעודיות כמו GPUs או TPUs, יכולות גם הן לסייע להגביר את מהירות ההסקה ולהפחית את דרישות כוח החישוב של מודלים לזיהוי אובייקטים מבוססי SAHI.
בסך הכל, בעוד ש-SAHI יכולה להיות גישה עוצמתית לאימון מודלים לזיהוי אובייקטים בתמונות פנורמיות, חשוב לשקול את המגבלות האפשריות של מסגרת זו, ולבחון אסטרטגיות לצמצום מגבלות אלו להשגת ביצועים מיטביים.
דוגמאות לשימוש בגלאים של עצמים קטנים מאוד ובתמונות גדולות
למרות האתגרים שבעבודה עם תמונות פנורמיות או זיהוי עצמים קטנים מאוד, ישנן מספר דוגמאות לאופן שבו ניתן להשתמש במודלים לזיהוי עצמים כדי להניב תועלת בעולם האמיתי.
רכבים אוטונומיים
מודלים לזיהוי אובייקטים יכולים לשמש בכלי רכב אוטונומיים כדי לזהות אובייקטים בסביבה, כגון הולכי רגל, מכוניות, תמרורי תנועה ומאפייני תשתית אחרים. בסביבות עירוניות, תמונות פנורמה מספקות שפע של מידע על הסביבה, מה שהופך אותן למקור נתונים מצוין למערכות המזהות אובייקטים שונים על הכביש.
מערכות אבטחה
מערכות אבטחה יכולות להשתמש במודלים לזיהוי אובייקטים כדי לזהות איומים פוטנציאליים בתוך עיר. לדוגמה, מצלמות CCTV המוצבות במרחבים ציבוריים יכולות להשתמש בשיטות כאלה לזיהוי אנשים ולזיהוי התנהגות חשודה, כגון אדם הנושא נשק או מתנהג בצורה בלתי יציבה.
גיאו-מרחבי
יישומים גיאו-מרחביים, כגון זיהוי אובייקטים מתמונות לוויין, יכולים גם הם להפיק תועלת משימוש בגלאי אובייקטים קטנים מאוד. למעשה, זיהוי וסיווג של אובייקטים קטנים בתמונות לוויין הוא קריטי ליישומים רבים בתחומים כגון ניטור סביבתי, חקלאות וביטחון לאומי.
מודלים לזיהוי אובייקטים יכולים לשמש לניטור סביבתי כדי לזהות שינויים בסביבה, כגון כריתת יערות או זיהום. תמונות בקנה מידה גדול יכולות לספק תמונה מקיפה של הסביבה, מה שהופך אותן למקור נתונים מצוין למערכת זיהוי מתקדמת.
הדמיה רפואית ומיקרוסקופיה
בדימות רפואית, זיהוי עצמים קטנים חיוני לזיהוי ואבחון מחלות כמו סרטן. לדוגמה, זיהוי גידולים או נגעים זעירים בסריקות MRI או CT יכול להיות קריטי לאבחון מוקדם ולטיפול. במיקרוסקופיה, זיהוי עצמים קטנים משמש לזיהוי וניתוח המבנה וההתנהגות של אורגניזמים מיקרוסקופיים ותאים. זה יכול לכלול זיהוי חלבונים ספציפיים, מבנים תאיים או פתוגנים.
זיהוי אובייקטים בתמונות פנורמיות גדולות: סיכום
בניית מודלים של ראייה ממוחשבת לזיהוי אובייקטים בתצלומי פנורמה של ערים באמצעות מסגרת SAHI היא תחום מחקר מרתק עם יישומים פוטנציאליים רבים. מסגרת SAHI מאפשרת זיהוי אובייקטים מדויק ויעיל בתמונות, מה שהופך אותה לבחירה אידיאלית לפיתוח מודלים של ראייה ממוחשבת לתצלומי פנורמה. עם הזמינות ההולכת וגוברת של תצלומי פנורמה מפלטפורמות כמו Google Maps, היישומים הפוטנציאליים של מודלים לזיהוי אובייקטים בתצלומי פנורמה של ערים הם אין-סופיים.
אם ברצונכם להשתמש במודלים מתקדמים לזיהוי אובייקטים במוצר שלכם, בקרו בעמוד ההצעים שלנו לבינה מלאכותית ולמידת מכונה וצרו קשר איתנו למידע נוסף.
משאבים נוספים: מסגרת SAHI
זיהוי אובייקטים בתמונות פנורמיות גדולות כולל זיהוי ואיתור אובייקטים בתוך תצלומים ברזולוציה גבוהה במיוחד עם שדה ראייה רחב. מכיוון שתמונות אלו גדולות בהרבה מתמונות רגילות, נדרשות טכניקות עיבוד מיוחדות כדי לנתח אותן ביעילות.
האתגרים העיקריים הם הגודל העצום שלהם, אשר דורש כוח מחשוב משמעותי, והקושי לשמור על דיוק בעת זיהוי עצמים קטנים בתוך סצנות גדולות ומפורטות.
אריחי תמונה (Image tiling) כרוכים בחלוקה של פנורמה גדולה למקטעים קטנים וקלים יותר לניהול. כל מקטע מעובד בנפרד לזיהוי אובייקטים, מה שמקל על הטיפול ברזולוציות גבוהות ומשפר את ביצועי הזיהוי.
כלים נפוצים כוללים מסגרות למידה עמוקה כגון TensorFlow ו-PyTorch, וכן מודלים לזיהוי אובייקטים כגון YOLO ו-Faster R-CNN. אלה משולבים לעתים קרובות עם צינורות עיבוד מקדמי מותאמים אישית לטיפול בתמונות גדולות.
תעשיות כגון מעקב ביטחוני, ניטור תנועה, מחקר סביבתי ובדיקה תעשייתית יכולות כולן להפיק תועלת רבה מתמונות פנורמיות, המאפשרות לנטר אזורים נרחבים ולנתח אובייקטים בפירוט.
נצלו את ה-AI להשגת יתרון תחרותי. צרו קשר עם המומחה שלנו כדי לדון בצרכים שלכם.
arrow_circle_right הבלוג שלנו