Taggart
תקן 5568 ומסמכי PDF: מה באמת נדרש
התקן הישראלי לנגישות אתרים ומה שהוא אומר על מסמכים. מה ניתן לבדוק אוטומטית, מה דורש מורשה נגישות, ולמה מסמכים בעברית נכשלים אחרת.
למה העמוד הזה קצר בפרטים משפטיים
תקן ישראלי 5568 יושב בתוך תקנות הנגישות, ואופן החלתו על מערך מסמכים מסוים תלוי בגוף, בשירות ובחובה. זו קביעה של מורשה נגישות מוסמך, וספק תוכנה שיטען אחרת יגרום לכם נזק.
לכן העמוד הזה עוסק בחלק שאנחנו כן יכולים לדבר עליו: מה בפועל משתבש במסמכי PDF בעברית, ומה כרוך בתיקון.
שלוש התקלות שחוזרות
1. טקסט שמור בסדר ויזואלי
זרם התוכן של PDF מצייר אותיות בקואורדינטות ואין לו מושג של כיוון. יש שתי דרכים לפרוס שורה מימין לשמאל.
סדר לוגי — שומרים את התווים בסדר שבו אדם כותב אותם, ומציירים מימין לשמאל: כל פעולת הצגת טקסט עוקבת זזה ל‑x קטן יותר. זה הנכון, וזה מה שייצוא מודרני מ‑InDesign או מ‑Word עושה.
סדר ויזואלי — הופכים קודם את התווים, ואז מציירים משמאל לימין כמו טקסט לטיני. האותיות נוחתות בדיוק באותם מקומות. הדף זהה. המחרוזת השמורה היא המשפט הפוך.
לוגי: הנגשת מסמכים דיגיטליים היא חובה חוקית בישראל
ויזואלי: לארשיב תיקוח הבוח איה םיילטיגיד םיכמסמ תשגנה
קורא מסך מפעיל על השורה השנייה את אלגוריתם ה‑bidi והופך אותה שוב, בהנחה שהיא הייתה לוגית מלכתחילה. התוצאה אינה אף אחת מהשתיים.
איך בודקים בעשר שניות: סמנו שורה בעברית, העתיקו, הדביקו בעורך טקסט פשוט. אם היא יוצאת הפוכה — הקובץ שמור בסדר ויזואלי.
2. שפת מסמך שנשארה en-US
מפיקי PDF מגדירים אנגלית כברירת מחדל, ואיש אינו משנה, כי שום דבר על המסך לא נראה שגוי.
לסינתיסייזר אנגלי אין פונמות לעברית. בהינתן שלום הוא מאיית את שמות האותיות, מפיק רעש, או משתתק. זו לא עברית במבטא — זה כלום.
איך בודקים: קובץ ← מאפיינים ← מתקדם ← אפשרויות קריאה ← שפה ב‑Acrobat. חמש שניות.
3. סדר טורים משמאל לימין
כלי תיוג אוטומטי סורקים את הדף משמאל לימין ומלמעלה למטה, ללא קשר לכתב. בפריסת שני טורים בעברית הסדר הנכון מתחיל בטור הימני, ולכן המסמך מתויג כשתי מחציות משולבות.
למה כל הבודקים מאשרים את הקובץ
כי הם שואלים שאלה אחרת.
בודקי תאימות שואלים אם ניתן למפות את הטקסט ל‑Unicode, ואם הוגדרה שפה. שתי התשובות חיוביות במסמך ויזואלי עם en-US. השאלה אם התווים נמצאים בסדר שבו אדם כתב אותם, ואם השפה שהוגדרה היא הנכונה, פשוט אינה נשאלת — פרוטוקול Matterhorn מסמן אותה כדורשת שיקול דעת אנושי.
התוצאה: מסמך שעובר את PAC, את veraPDF ואת הבודק של Acrobat, ונקרא כג׳יבריש.
מה אפשר לעשות בחינם
לזהות את שלוש התקלות. העתקה‑הדבקה לסדר הוויזואלי, מאפייני הקובץ לשפה, ולוח התגיות לסדר הטורים. הכול ב‑Acrobat או בכל מציג.
לתקן את השפה. קובץ ← מאפיינים ← מתקדם ← אפשרויות קריאה ← שפה. שלושים שניות, וזה השיפור הגדול ביותר ליחידת מאמץ בכל התחום.
לתקן את סדר הטורים. גרירת תגיות בלוח התגיות. איטי, אבל חינם.
לתקן סדר ויזואלי — אי אפשר. אין ב‑Acrobat הגדרה שממירה סדר ויזואלי לסדר לוגי, כי ל‑Acrobat אין מושג שהסדר השמור עשוי להיות שגוי. הדרך החינמית היחידה היא לייצא מחדש ממסמך המקור עם מפיק מודרני. אם המקור אבד, או שהקובץ הגיע מפורטל ממשלתי, גם היא נסגרה.
מה Taggart עושה
מזהה סדר ויזואלי מבנית — משווה את הסדר שבו האותיות מצוירות לעומת מיקומן על הדף. שורה מימין לשמאל שסדר הציור שלה נע משמאל לימין נשמרה ויזואלית. זו עובדה על הקובץ, לא ניחוש לגבי המילים.
מאשש מול מורפולוגיה עברית: חמש האותיות הסופיות ך ם ן ף ץ מופיעות רק בסוף מילה, ולכן טקסט הפוך ממקם אותן בהתחלה. אין צורך במילון.
מתקן בהצמדת /ActualText בסדר לוגי לרכיב המבנה, בלי לגעת בזרם התוכן. האותיות המצוירות נשארות זהות; הקובץ המתוקן נראה זהה פיקסל בפיקסל, ומדד הדמיון המבני מודד 1.000000.
מגדיר /Lang לכל קטע — כולל לקטעים באנגלית בתוך מסמך עברי, מקרה שנכשל בדיוק באותה דרך הפוכה.
ומציע את תקן 5568 כפרופיל בדיקה נבחר לצד PDF/UA-1 ו‑WCAG 2.1 AA, מתוך הנחה מעשית שמסמך עברי אינו יכול לעמוד בתקן בזמן שהוא נקרא לאחור.
מה Taggart לא יעשה
לא יקבע שאתם עומדים בתקן. שום כלי אינו יכול, וכלי שטוען אחרת מוכר לכם חשיפה ולא פתרון.
מה שהוא כן נותן: דוח שמפרט מה נבדק, מה נמצא, מה תוקן, מה אושר ובאיזה נימוק, מי הכריע ומתי, גרסת הכלי, וטביעת ה‑SHA-256 של קובץ המקור והפלט. את ההכרעה נותן מורשה נגישות; הדוח הוא הראיה שעליה הוא נשען.
שאלות נפוצות
האם תקן 5568 חל על קובצי PDF?
התקן עוסק בנגישות שירותי אינטרנט, ומסמכים המפורסמים כחלק מהשירות נחשבים בדרך כלל בתחולה. התחולה המדויקת על מערך מסמכים מסוים היא שאלה משפטית — אמתו אותה מול מורשה נגישות מוסמך. Taggart אינו קובע קביעות משפטיות, וגם עמוד זה אינו ייעוץ.
תקן 5568 זהה ל‑WCAG?
הוא מבוסס על WCAG 2.0 רמה AA עם תוספות ישראליות, בהן דרישות סביב עברית והצהרת הנגישות. עמידה ב‑WCAG 2.1 רמה AA מביאה אתכם רוב הדרך, אך אינה מכסה אוטומטית את התוספות.
למה מסמכים בעברית נכשלים אחרת ממסמכים באנגלית?
בגלל אופן שמירת הטקסט. הרבה מסמכי PDF בעברית — במיוחד ממערכות ממשלתיות ומשפטיות ותיקות — שומרים את התווים הפוכים מראש, כך שהדף מוצג נכון והטקסט המחולץ במראה. כל בודק בשוק מאשר את הקובץ. קורא מסך מקריא אותו לאחור.
מה צריך לספק ללקוח או לרגולטור?
ראיות, לא הצהרה. דוח שמפרט מה נבדק, מה נמצא, מה תוקן, מה אושר כמות שהוא ובאיזה נימוק, מי הכריע ומתי. Taggart מפיק בדיוק את הדוח הזה, ובכל עותק מופיע המשפט שאין זו קביעה משפטית.
תנאי כשל קשורים
העמודים הטכניים המלאים באנגלית, עם קטעי קוד ופתרונות ב‑Acrobat.
- TG-RTL-001 Right-to-left text is stored in visual order
- TG-RTL-002 A right-to-left run has no language declaration
- TG-RTL-004 Reading order is not right-to-left aware
- 11-007 Natural language is not appropriate
- 09-001 Tags are not in logical reading order
בדקו קובץ משלכם. הבודק חינמי וללא הגבלה — בלי מגבלת עמודים, בלי סימן מים, בלי חשבון.
בדיקות חדשות, כשהן נכתבות
הודעה קצרה כשעולה אצווה של עמודי בדיקות, כשמערך הכללים משתנה, או כששוחרר משהו. לא יותר מפעם בחודש, ושום דבר מעבר לזה.
ביטול הרשמה בלחיצה אחת, בכל הודעה. איננו מוכרים או משתפים את הרשימה.
עודכן לאחרונה . אין באמור ייעוץ משפטי.