Taggart
איך מנגישים קובץ PDF — המדריך המלא
כל העבודה מקצה לקצה: מה חייב להיות נכון, באיזה סדר לעשות את זה, מה באמת מכני, ואיפה נדרשת הכרעה אנושית. עם זמנים אמיתיים.
מה פירוש «נגיש» במסמך PDF
שישה דברים חייבים להיות נכונים. כל מה שלמטה משרת אחד מהם.
- כל תוכן נגיש לקריאה. כל פעולת ציור נמצאת בתוך תגית או מסומנת כארטיפקט. תוכן שאינו באף אחד מהם בלתי נראה לטכנולוגיה מסייעת, ולא משנה כמה הוא בולט בעמוד.
- סדר הקריאה הוא סדר המשמעות. עץ המבנה, ולא הפריסה על הדף, קובע מה נקרא ומתי. ובעברית — זה המקום שבו כלים אוטומטיים טועים באופן שיטתי, כי הם הולכים משמאל לימין.
- המבנה מתויג בכנות. כותרות הן כותרות וברמה הנכונה, רשימות הן רשימות, ולטבלאות יש כותרות שמקושרות לתאים.
- לתוכן שאינו טקסט יש מקבילה טקסטואלית. לתמונות יש טקסט חלופי שמעביר מה התמונה עושה שם. תמונות דקורטיביות הן ארטיפקטים, לא תמונות עם טקסט חלופי ריק.
- השפה מוצהרת — ברמת המסמך, וגם ברמת הקטע בכל מקום שבו היא משתנה.
- המסמך מזהה את עצמו. כותרת במטא‑דאטה, והוראה לקורא להציג אותה במקום שם הקובץ.
מכונה יכולה לבדוק חמישה מהם. את השלישי והרביעי היא יכולה לבדוק רק מבחינת קיום, לעולם לא מבחינת נכונות. הפער הזה הוא כל הנושא.
קודם כול: איפה לעשות את העבודה
לפני שפותחים כלי כלשהו, ענו על שאלה אחת: המסמך הזה ייוצר שוב?
אם כן — תקנו את המקור. דוח שמופק כל חודש, טופס שמתעדכן, תבנית. כל שעה שמושקעת ב‑Acrobat אובדת בייצוא הבא. הגדירו את סגנונות הכותרת בוורד, את הטקסט החלופי ב‑InDesign, את אפשרויות הייצוא פעם אחת — והנגישות נוסעת עם המסמך מכאן והלאה. המדריך לוורד מכסה את ההגדרות שחשובות.
אם לא — תקנו את ה‑PDF. ארכיון, חוזה חתום, משהו שהמקור שלו נעלם לפני שלוש חילופי עובדים.
אם זה סריקה — אף אחד מהשניים. עמוד סרוק הוא תמונה של טקסט. תיוג שלו מייצר תמונה מתויגת. צריך OCR קודם.
בדקו לפני שמתחילים
הריצו בדיקה לפני הכול, גם אם אתם בטוחים שהקובץ גרוע. זה לוקח שניות ומשנה את מה שתעשו:
- קובץ שנכשל רק במטא‑דאטה ובשפה הוא עשר דקות עבודה, לא אחר צהריים;
- קובץ בלי עץ מבנה בכלל דורש תיוג לפני שכל דבר אחר משמעותי;
- קובץ שהוא תמונה אחת גדולה דורש תהליך אחר לגמרי.
טאגארט בודק קובץ בחינם, בלי חשבון ובלי מגבלת עמודים, וגם כלים חינמיים אחרים יעשו זאת.
הסדר, ולמה דווקא הוא
כל שלב משנה את מה שהשלב הבא צריך להתמודד איתו. ביצוע לא לפי הסדר פירושו לעשות כמה מהם פעמיים — במסמך אמיתי, בערך שליש מהזמן הכולל.
1. תייגו את המסמך, אם אין לו תגיות
תיוג אוטומטי קודם. בניית עץ מבנה ביד היא שעות רבות; הכלי האוטומטי קולע בגבולות פסקאות ובקישור לתוכן המסומן, וטועה בחלקים המעניינים — שהם בדיוק החלקים שהייתם רוצים לעשות בעצמכם.
2. סמנו את רהיטי העמוד כארטיפקטים
כותרות רצות, מספרי עמודים, קווים דקורטיביים. עשו זאת לפני תיקון סדר הקריאה, כי כל אלמנט שסומן כארטיפקט הוא אלמנט אחד פחות שצריך להזיז.
3. תקנו את סדר הקריאה
השלב היקר ביותר והחשוב ביותר. בעברית הוא גם השלב שבו התיוג האוטומטי טועה באופן צפוי: הוא הולך משמאל לימין, והסדר הנכון בעמוד דו‑טורי בעברית מתחיל בטור הימני. סדר קריאה ב‑PDF בעברית מסביר בדיוק למה זה קורה.
זה גם המקום לבדוק אם הטקסט אוחסן בסדר ויזואלי — כלומר הפוך, אות אחר אות. זו תקלה שאין לה מקבילה באנגלית, היא נראית תקינה לחלוטין על המסך, והיא הופכת את המסמך לבלתי קריא לקורא מסך. תנאי הכשל מתאר אותה במלואה.
4. תקנו את סוגי המבנה
כותרות ברמות הנכונות בלי דילוגים, רשימות כ‑L/LI/LBody, טבלאות עם TR ו‑TH. עכשיו, ולא קודם, כי סידור מחדש מזיז אלמנטים והסוגים שלהם קלים יותר לבדיקה כשהם כבר ברצף הנכון.
5. כתבו את הטקסט החלופי
אחרי שהתמונות נמצאות במקום הנכון, כדי שתתארו אותן בהקשר שבו הקורא יפגוש אותן. זו כתיבה, לא הגדרה, וזה השלב שאף כלי לא יעשה במקומכם.
6. הגדירו שפה, כותרת ומטא‑דאטה
שפת המסמך, שפה ברמת הקטע בכל מקום שבו הכתב משתנה, כותרת המסמך, ו‑DisplayDocTitle כדי שהקורא יכריז את הכותרת ולא את שם הקובץ. שתי דקות, ושלוש מתוך שש הדרישות.
בעברית זה קריטי במיוחד: מסמך שמצהיר /Lang en-US והתוכן שלו עברי — הסינתיסייזר קורא אותיות עבריות בפונטיקה אנגלית, והתוצאה אינה «מבטא», היא רעש.
7. טפלו בקישורים ובשדות טופס
לכל הערת קישור דרוש תיאור; לכל פקד טופס דרוש אלמנט Form בעץ המבנה ותיאור. טפסים הם המסמכים היקרים ביותר להנגשה ידנית, כי העבודה היא לכל שדה בנפרד.
8. בדקו שוב, ואז הקשיבו
הריצו את הבודק שוב — ואז הקשיבו למסמך. קובץ יכול לעבור כל בדיקה אוטומטית ולהיות בלתי שמיש, והדרך היחידה לגלות היא לשמוע אותו.
מה מכני ומה לא
מכני באמת — בלי שיקול דעת, בלי סיכון: זרם המטא‑דאטה XMP, DisplayDocTitle, קינון ארטיפקטים ותוכן, מפת התפקידים, תיקון רמות כותרת כשההיררכיה ידועה, Scope על תאים שכבר מסומנים ככותרות, מיקום פקדי טופס בעץ, ניקוי דגל Suspects.
דורש הכרעה בכל פעם: איזו פסקה היא כותרת, מה התמונה מעבירה, אילו תאים הם כותרות, איפה סרגל צד שייך בסדר, והאם שורה חוזרת היא כותרת רצה או כותרת סעיף.
בכלל לא ניתן לעשות ב‑PDF: להפוך סריקה לטקסט, לתקן ניגודיות צבע, לשחזר טבלה שנבנתה מרווחים.
כלי שמציע לעשות את הקבוצה השנייה בלי לשאול — מנחש. כלי שלא אומר לאיזו קבוצה שינוי שייך — מסתיר את הניחוש.
איך יודעים שסיימתם
סיימתם כשכל אלה נכונים, ולא לפני:
- הבודק אינו מדווח על אף כשל שניתן לבדיקה אוטומטית;
- הקשבתם למסמך עם קורא מסך, מההתחלה לסוף, לפחות פעם אחת;
- הטקסט החלופי של כל תמונה נכתב על ידי מי שידע מה התמונה עושה שם;
- הכותרות של כל טבלה אושרו על ידי מי שקרא את הטבלה;
- סדר הקריאה אושר על ידי מי שקרא את המסמך.
הראשון הוא הזול ביותר והיחיד שכלי יכול לומר לכם עליו. ארבעת האחרים הם העבודה.
בדקו קובץ בחינם ← · תקן 5568 ← · מחירים ←
שאלות נפוצות
כמה זמן זה לוקח?
מסמך של חמישה עמודים שיוצא מוורד עם סגנונות כותרת אמיתיים: רבע שעה עד חצי שעה. אותו מסמך בלי הסגנונות: שעה. דוח של עשרים עמודים עם טבלאות ותרשימים: שעתיים עד ארבע. מסמך סרוק: מתחילים מהמקור, כי אין מה לתייג. מי שנוקב במחיר אחיד לעמוד מְמַצֵּעַ על פני מסמכים שנבדלים זה מזה פי עשרה.
אפשר לעשות את זה אוטומטית?
חלקים. מטא‑דאטה, שפה, סימון רהיטי עמוד כארטיפקט, כותרות טבלה כשהן כבר מסומנות — אלה מכניים וכלי אמור לעשות אותם בלי לשאול. סדר קריאה בפריסה מורכבת, טקסט חלופי, אילו תאים הם כותרות, והאם שורה מודגשת היא כותרת: אלה הכרעות על משמעות, ולאף כלי אין את המשמעות של המסמך שלכם.
לתקן את ה‑PDF או את המקור?
את המקור, בכל פעם שהוא עדיין קיים ותצטרכו את המסמך שוב. תיקונים שנעשים ב‑Acrobat נמחקים ברגע שמישהו מייצא מחדש. מתקנים את ה‑PDF כשהמקור אבד, כשהמסמך סופי וארכיוני, או כשהמקור הוא מערכת שאי אפשר לשנות.
מסמך מתויג הוא מסמך נגיש?
לא. מתויג פירושו שקיים עץ מבנה. נגיש פירושו שהעץ נכון, שסדר הקריאה תואם את המשמעות, שלתמונות יש תיאור, שלטבלאות יש כותרות ושהשפה מוצהרת. כל מסמך נגיש הוא מתויג; הרבה מסמכים מתויגים בלתי שמישים לחלוטין.
לאיזה תקן לכוון בישראל?
תקן ישראלי 5568 מאמץ את WCAG ומוסיף דרישות ייחודיות לעברית. בפועל מכוונים ל‑WCAG 2.1 ברמה AA, ומשתמשים ב‑PDF/UA-1 כמבחן שאפשר להריץ — הוא היחיד מהשניים שמכונה יכולה לבדוק.
תנאי כשל קשורים
העמודים הטכניים המלאים באנגלית, עם קטעי קוד ופתרונות ב‑Acrobat.
- 01-005 Content is neither marked as Artifact nor tagged as real content
- 09-001 Tags are not in logical reading order
- 14-001 Headings are not tagged
- 13-001 Graphics objects are not tagged with a Figure tag
- 07-001 ViewerPreferences does not contain DisplayDocTitle
- 11-001 Natural language for text in page content cannot be determined
- TG-RTL-001 Right-to-left text is stored in visual order
בדקו קובץ משלכם. הבודק חינמי וללא הגבלה — בלי מגבלת עמודים, בלי סימן מים, בלי חשבון.
בדיקות חדשות, כשהן נכתבות
הודעה קצרה כשעולה אצווה של עמודי בדיקות, כשמערך הכללים משתנה, או כששוחרר משהו. לא יותר מפעם בחודש, ושום דבר מעבר לזה.
ביטול הרשמה בלחיצה אחת, בכל הודעה. איננו מוכרים או משתפים את הרשימה.
עודכן לאחרונה . אין באמור ייעוץ משפטי.