ה-EDPB מפרסם טיוטת הנחיות בנושא קצירת מידע לצורך אימון AI
תקציר
- נגישות המידע האישי לציבור לא מכשירה שימוש באימון בינה מלאכותית: בהנחיות 03/2026, שפורסמו להערות הציבור ב-7 ביולי 2026, המועצה האירופית להגנת המידע (EDPB) מבהירה כי העובדה שמידע אישי זמין לציבור באופן מקוון אינה מתירה, כשלעצמה, את איסופו ושימוש חוזר בו לצורך אימון מודלים של בינה מלאכותית תחת ה-GDPR.
- קצירת מידע מהרשת (Web Scraping) לצורך אימון בינה מלאכותית תעמוד בפני בחינה קפדנית יותר של ה-GDPR: ההנחיות מבהירות כי חברות המסתמכות על מידע שנקצר חייבות להעריך בקפידה את הבסיס המשפטי שלהן, את חובות השקיפות, את האמצעים למזעור מידע ואת הטיפול במידע רגיש.
- ההנחיות מסמנות שינוי משמעותי בכיוון הרגולטורי: חברות המשתמשות במידע שנקצר או במידע של צד שלישי לצורך אימון בינה מלאכותית צריכות להתחיל להעריך מחדש את הבסיס המשפטי שלהן, את הקריטריונים לאיסוף, את מדיניות הפרטיות, את האמצעים הטכניים ואת חלוקת התפקידים לאורך שרשרת האספקה של הבינה המלאכותית.
ב-7 ביולי 2026, המועצה האירופית להגנת מידע ("EDPB") פרסמה להערות הציבור את הנחיות 03/2026 בנושא קצירת מידע מהרשת (Web Scraping) בהקשר של בינה מלאכותית יוצרת. ההנחיות מפרטות את עמדת ה-EDPB בנוגע לקצירת מידע אישי הזמין לציבור לצורך אימון מודלים של בינה מלאכותית יוצרת, ומבהירות כי שימוש כזה כפוף ל-GDPR.
ההנחיות חלות על ארגונים שמבצעים זאת בעצמם, מנחים צדדים שלישיים לעשות זאת, או רוכשים מאגרי מידע שכבר "נקצרו". הדבר עשוי לחול כאשר המטרה היא אימון מודלים חדשים של בינה מלאכותית יוצרת או כיול של מודל קיים.
ה-EDPB מבהיר כי עקרונות ה-GDPR של שקיפות, מזעור מידע, דיוק ועיבוד חוקי – חלים במלואם על עיבוד מידע שנסרק לצורך אימון בינה מלאכותית. זמינות ציבורית של המידע אינה מהווה, כשלעצמה, בסיס משפטי לשימוש בו באימון בינה מלאכותית.
נקודות עיקריות
- GDPR חל במלואו על אימון בינה מלאכותית על מידע ציבורי. חילוץ ואחסון של מידע אישי באמצעות קצירת מידע מהרשת למטרות אימון בינה מלאכותית מהווים פעולות עיבוד תחת ה-GDPR, גם אם המידע זמין לציבור
- אינטרס לגיטימי כבסיס משפטי. בעל השליטה במידע (Controller) חייב לזהות אינטרס לגיטימי ממשי וספציפי, להראות שהקצירה הכרחית באמת לאימון בינה מלאכותית, ולהראות שאינטרס זה אינו נסוג מפני זכויותיהם של יחידים.
- מזעור מידע לאורך כל מחזור החיים של אימון הבינה המלאכותית. בעלי השליטה במידע חייבים להגדיר קריטריונים מדויקים לאיסוף לפני תחילת הקצירה, ליישם סינון במהלך האיסוף, ולבצע אנונימיזציה, פסאודונימיזציה או להחליף במידע סינתטי במידת הצורך – כל זאת לפני תחילת האימון.
- שקיפות. כאשר הודעה אישית אינה אפשרית או בלתי סבירה בנסיבות העניין, בעלי השליטה במידע חייבים לפרסם הודעות ציבוריות מקיפות המכסות את פעילויות הקצירה שלהם, הקטגוריות של המידע הנאסף, מקורות המידע, הבסיס המשפטי וזכויות נושאי המידע הזמינות.
- מידע בעל רגישות מיוחדת – נדרשים אמצעי הגנה מוגברים. אם מעורב מידע בעל רגישות מיוחדת, בעלי השליטה במידע זקוקים הן לבסיס חוקי תחת סעיף 6 ל-GDPR והן לתנאי נפרד תחת סעיף 9 ל-GDPR. יש ליישם אמצעים טכניים וארגוניים למניעת איסוף מידע כזה, וכאשר מתרחש איסוף אגבי, יש למחוק את המידע מיידית. יש ליישם אמצעי הגנה גם לאורך פיתוח ופריסת המודל כדי למנוע חשיפת מידע.
השלכות מעשיות
בחינה רגולטורית מוגברת על מידע לאימון בינה מלאכותית: ההנחיות משקפות בחינה רגולטורית ברורה של מאגרי מידע לאימון בינה מלאכותית. ארגונים המשתמשים במידע אישי הנגיש לציבור צריכים לקבוע את הנימוק המתיר שימוש כזה מלבד היותו של המידע זמין באופן מקוון.
דינמיקת בעל שליטה מול מעבד: כאשר מפתח בינה מלאכותית מנחה צד שלישי לקצור מידע וקובע את מטרות ואמצעי האיסוף, המפתח יהיה בעל השליטה. באופן כללי, כאשר שני הצדדים קובעים במשותף את מטרות ואמצעי העיבוד, הם יהיו בעלי שליטה משותפים. הדבר עשוי להשפיע על האופן שבו יש לבנות הסכמי עיבוד מידע (DPA) לאורך שרשרת האספקה.
קשה יותר להגן על קצירה לא ממוקדת: קצירת רשת רחבה ולא ממוקדת ללא קריטריונים מחמירים לאיסוף המידע נושאת כעת סיכון רגולטורי משמעותי. ההנחיות מבהירות כי יש לטפל במזעור המידע לפני תחילת האיסוף ולחזקו במהלך האיסוף ולאחריו, מה שמחייב ארגונים ליישם מיקוד טכני מדויק לפני חילוץ המידע.
המלצות לארגונים
- מפו את כל מאגרי המידע הכוללים מידע שנקצר או מידע מצד שלישי, והעריכו את הסיכון הגלום בהם בהתייחס לרגישות המידע.
- אמתו את חוקיות מקורות המידע, והבטיחו שקיפות של תהליך האיסוף, כולל חותמות זמן ובדיקות דיוק.
- בצעו הערכות אינטרס לגיטימי לתהליכי קצירה קיימים ומתוכננים, תוך שימת לב מיוחדת להכרחיות, למידע של קטינים ולעמידה בהגבלות אתרים.
- עדכנו את מדיניות הפרטיות כדי שתשקף מטרות אימון בינה מלאכותית, כולל קטגוריות מידע, מקור, בסיס חוקי וזכויות נושאי מידע.
לאור הנחיות ה-EDPB, ארגונים אינם יכולים עוד להסתמך על זמינותו הציבורית של מידע כהצדקה יחידה לאימון בינה מלאכותית. אנו ממליצים ללקוחותינו לבחון את מנגנוני איסוף המידע שלהם, לבקר את מאגרי המידע לאימון בינה מלאכותית, לעדכן את מדיניות הפרטיות ולבחון מחדש הסכמים עם ספקים כדי להבטיח התאמה קפדנית לשינויים רגולטוריים אלו.
***
מחלקת הפרטיות, הבינה המלאכותית והסייבר שלנו תשמח לסייע בנוגע לעמידה בהתפתחויות רגולטוריות ושינויים פוטנציאליים בהקשר של בינה מלאכותית.
ד"ר אבישי קליין הוא שותף וראש מחלקת פרטיות, סייבר ובינה מלאכותית במשרד.
עו"ד מאשה יודשקין היא עורכת דין במחלקת פרטיות, סייבר ובינה מלאכותית במשרד.
עו"ד אביתר ריטש הוא עורך דין במחלקת פרטיות, סייבר ובינה מלאכותית במשרד.

