סקיל ל-Claude · מהנדסים

Web Scraper (web-scraping)

סקיל לאיסוף נתונים מאתרים שבוחר לבד את השיטה הזולה והמהירה שעובדת

מאתyfe404 כוכבים בגיטהאב95 סוגסקיל רישיוןMIT עדכון אחרון במאגר18.03.2026 בדיקת התקנהעבדה בבדיקה אוטומטית, 30.09.2026

מה זה Web Scraper (web-scraping)?

Web Scraper הוא סקיל שמלמד את Claude לגשת לאיסוף נתונים מאתר כמו מקצוען: קודם להבין איך האתר בנוי ואיפה המידע נמצא, ורק אחר כך לכתוב קוד. הוא מתחיל בבקשת curl פשוטה, מפעיל דפדפן רק כשאין ברירה, מאמת כל ממצא ויודע להפוך את הסקרייפר ל-Actor שרץ בענן של Apify.

רוב הניסיונות לאסוף נתונים מאתר נכשלים באותה נקודה: קופצים ישר לכתיבת קוד שמחקה דפדפן, והוא נשבר אחרי שבוע. הסקיל הזה, שנקרא בתוך Claude בשם web-scraping, מלמד סדר עבודה אחר. הוא מתחיל בבקשה אחת עם curl, מזהה על איזו פלטפורמה האתר בנוי (Next.js, WordPress, Shopify, Wix ועוד), ובודק אם המידע כבר נמצא בקוד של העמוד, במפת האתר או ב-API פנימי שהאתר משתמש בו.

העבודה מחולקת לשלבים עם שערי איכות. אם כל המידע נמצא כבר בשלב הראשון, מדלגים על הדפדפן. אם חסר משהו, עוברים לדפדפן, לוכדים את התעבורה ומחפשים את ה-API שמאחורי העמוד. לפני שמסכמים, כל בורר, נתיב ו-API נבדקים בפועל, ובסוף מתקבל דוח עם ביקורת עצמית: מה לא נבדק, אילו הנחות נעשו ומה עלול להישבר עם הזמן. רק אחרי זה כותבים קוד, מתחילים בדגימה קטנה ומגדילים בהדרגה.

לשלב ההפקה הסקיל מנחה לבנות Actor ב-Apify ב-TypeScript עם הפקודה apify create, ומגיע עם תבניות ודוגמאות. חשוב לדעת מראש ששלבי הדפדפן נשענים על שרת MCP נפרד של אותו מפתח בשם proxy-mcp, ושהסקיל עודכן לאחרונה במרץ 2026, כך שחלק משמות הכלים בו נכתבו לגרסה קודמת של proxy-mcp. אם מפעילים את Actor בענן של Apify, יש לשירות תמחור משלו.

למי זה מתאים

  • חנויות אונליין שרוצות לעקוב אחרי מחירים או מלאי אצל ספקים, באתרים שמותר לאסוף מהם
  • סוכנויות ואנשי מחקר שמכינים טבלאות מתוך מידע ציבורי, כמו רשימות סניפים או קטלוגים
  • מפתחים שבונים סקרייפרים ורוצים ש-Claude יתכנן לפני שהוא כותב קוד
  • מי שעובד עם Apify ורוצה לבנות Actor ב-TypeScript לפי הדרך המומלצת

מה הוא עושה

סיור לפני קוד

בשלב הראשון Claude שולח בקשה אחת עם curl, בודק כותרות תגובה, מזהה את הפלטפורמה, מחפש את נתוני היעד בקוד העמוד ובודק אם יש מפת אתר. לפעמים זה כל מה שצריך.

זיהוי פלטפורמה

טבלאות זיהוי מראות ל-Claude איפה המידע נמצא בכל פלטפורמה, למשל __NEXT_DATA__ ב-Next.js, ה-API של WordPress, או הכתובת products.json בחנויות Shopify, כך שהוא לא מחפש בכל מקום.

דפדפן רק כשצריך

כשהמידע נטען רק ב-JavaScript, Claude מפעיל דפדפן דרך proxy-mcp, לוכד את כל התעבורה ומחפש API פנימי, שבדרך כלל מהיר ויציב יותר מקריאת העמוד.

אימות של כל ממצא

כל בורר, נתיב JSON או API שמופיע בדוח נבדק בפועל ומסומן אם אומת במלואו, חלקית או לא, כך שלא בונים קוד על הנחה שגויה.

דוח עם ביקורת עצמית

הדוח הסופי כולל גם את מה שחסר: שלבים שדולגו, הנחות שנעשו וסיכון שהאתר ישתנה, והמלצה על השיטה המתאימה.

מימוש הדרגתי

הקוד מתחיל בגישה הפשוטה ביותר, נבדק על 5 עד 10 פריטים, ורק אז מתרחב או עובר לשיטה חלופית, עם טיפול בשגיאות בסוף.

Actor ב-Apify

הנחיות מלאות לבניית Actor ב-TypeScript: apify create, בחירה בין תבנית Cheerio לתבנית Playwright, סכמת קלט, בדיקה עם apify run ופרסום עם apify push.

דוגמאות שימוש

מה כותבים ל-Claude אחרי ההתקנה, ומה מקבלים.

בדיקה מהירה של אתר

מה לכתוב
quick recon: תבדוק על מה בנוי האתר הזה ואיפה נמצאים המחירים של המוצרים, בלי לפתוח דפדפן. [כתובת]

מה מקבלים: זיהוי הפלטפורמה, המקום שבו נמצא המידע (קוד העמוד, מפת אתר או API) והמלצה אם בכלל צריך דפדפן.

קטלוג מחנות Shopify של ספק

מה לכתוב
הספק שלי מחזיק חנות Shopify ונתן לי אישור לאסוף ממנה את הקטלוג. תאסוף את שם המוצר, המחיר והמלאי לכל המוצרים ותשמור לקובץ CSV.

מה מקבלים: Claude בודק קודם את נקודות המידע המוכרות של Shopify, מאמת אותן על כמה מוצרים, ואז מריץ איסוף מלא לקובץ CSV.

רשימת סניפים לטבלה

מה לכתוב
תאסוף מהעמוד הזה את כל הסניפים של הרשת עם כתובת, טלפון ושעות פתיחה. אם הרשימה נטענת בגלילה, תמצא את ה-API שמאחוריה.

מה מקבלים: טבלה מסודרת, יחד עם דוח קצר שמסביר מאיפה הגיע המידע ומה עלול להשתנות.

הפיכה לתהליך קבוע

מה לכתוב
Make this an Apify Actor: תהפוך את הסקרייפר שבנינו ל-Actor ב-TypeScript שאפשר להריץ פעם ביום.

מה מקבלים: פרויקט Actor שנוצר עם apify create, עם סכמת קלט, קוד מותאם ותבנית Cheerio או Playwright לפי מה שהתגלה בסיור, והוראות להרצה ולפרסום.

מה צריך לפני שמתחילים

  • Claude Code, ו-curl שקיים ברוב המחשבים
  • לשלבי הדפדפן: שרת ה-MCP בשם proxy-mcp של אותו מפתח, שדורש Node.js 20 ומעלה
  • לשלב ההפקה: Node.js, הכלי apify-cli וחשבון ב-Apify, שירות חיצוני עם תמחור משלו
  • אחריות משפטית: איסוף נתונים חייב לכבד את תנאי השימוש של האתר ואת חוקי הפרטיות

אין עדיין Claude Code? במדריך הזה יש התקנה צעד אחרי צעד.

מדריך התקנה

איך מתקינים את Web Scraper (web-scraping).

יש 3 דרכים, ומספיקה אחת מהן. הראשונה הכי פשוטה, בלי קוד בכלל.

1

הכי פשוט: באפליקציה של Claude, בלי שום קוד

מתאים ל-Claude במחשב ובדפדפן. לוקח דקה, ועושים את זה פעם אחת.

  1. מורידים את הסקילהורדת web-scraping.zip (115 KB)לא פותחים את הקובץ, מעלים אותו כמו שהוא.
  2. מדליקים פעם אחת את היכולתב-Claude נכנסים ל-Settings, ואז Capabilities, ומדליקים את Code execution and file creation.
  3. מעלים את הקובץנכנסים ל-Customize, ואז Skills, לוחצים על הפלוס, בוחרים Create skill ואז Upload a skill, ובוחרים את הקובץ שהורדתם.
  4. זהו, עובדיםמבקשים מ-Claude את המשימה במילים רגילות, והוא משתמש בסקיל לבד כשהוא רלוונטי.
2

ב-Claude Code: מדביקים הודעה אחת

פותחים שיחה חדשה ב-Claude Code, מעתיקים את ההודעה ומדביקים. כש-Claude מבקש אישור להריץ, לוחצים Allow.

ההודעה להדבקה
התקן בבקשה את הסקיל web-scraping (מהריפו yfe404/web-scraper) ל-Claude Code. הרץ את הפקודה הבאה ותגיד לי אם ההתקנה הצליחה:

D="$(mktemp -d)" && git clone --depth 1 -q https://github.com/yfe404/web-scraper "$D/repo" && rm -rf "$D/repo/.git" && mkdir -p ~/.claude/skills && rm -rf ~/.claude/skills/web-scraping && cp -R "$D/repo" ~/.claude/skills/web-scraping && rm -rf "$D" && echo "הותקן ✓"
3

בטרמינל, ידנית

למי שמעדיף להריץ בעצמו. מעתיקים לטרמינל ומריצים.

פקודות לטרמינל
git clone --depth 1 https://github.com/yfe404/web-scraper.git /tmp/web-scraping
rm -rf /tmp/web-scraping/.git
mkdir -p ~/.claude/skills
cp -R /tmp/web-scraping ~/.claude/skills/web-scraping
rm -rf /tmp/web-scraping
אחרי ההתקנה

צריך להפעיל מחדש את Claude Code. לשלבי הדפדפן מוסיפים את proxy-mcp לפי ה-README שלו: claude mcp add proxy-mcp -- npx -y "github:yfe404/proxy-mcp#semver:^3". לבניית Actor מתקינים את הכלי של Apify עם npm install -g apify-cli ומתחברים עם apify login. בלי שני אלה הסקיל עדיין עובד לשלב הסיור הראשון ולכתיבת קוד.

איך יודעים שזה עבד
  • מריצים ls ~/.claude/skills ומוודאים שיש תיקייה בשם web-scraping
  • שואלים את Claude: אילו סקילים יש לך? ומחפשים את web-scraping
  • כותבים "quick recon" עם כתובת של אתר ציבורי, ובודקים ש-Claude מתחיל בבקשת curl ומדווח על הפלטפורמה
עדכון

מריצים שוב את פקודת ההתקנה, והיא מחליפה את התיקייה בגרסה העדכנית מ-GitHub.

הסרה
פקודת הסרה
rm -rf ~/.claude/skills/web-scraping

איך משתמשים ביום יום

  1. הסקיל נטען כשמבקשים לאסוף נתונים: "Scrape", "תאסוף מידע מ...", "תוציא את המוצרים מ...". אפשר לכתוב את הבקשה בעברית.
  2. עומק העבודה נקבע לפי הניסוח: "quick recon" או "just check" מריץ רק את השלב הראשון, בקשה רגילה מריצה את רוב השלבים, ו-"full recon" מריץ הכל כולל בדיקת הגנות.
  3. כשנתקלים בחסימה או בשגיאת 403, הסקיל טוען הנחיות ייעודיות. לפני שממשיכים, כדאי לשאול אם החסימה לא מסמנת שהאתר פשוט לא מאשר איסוף.
  4. לשלב ההפקה כותבים "Make this an Apify Actor", והסקיל טוען את ההנחיות של Apify.

טיפים שימושיים

  • תנו לסיור לרוץ עד הסוף לפני שמבקשים קוד. הדוח חוסך בדרך כלל יותר זמן ממה שהוא לוקח.
  • אם יש לאתר API רשמי או ייצוא נתונים, העדיפו אותם על פני איסוף, כי הם יציבים יותר ובדרך כלל מותרים במפורש.
  • אם Claude מנסה להפעיל כלים של proxy-mcp בשמות שלא קיימים, הזכירו לו להריץ את רשימת הכלים הנוכחית של השרת ולהשתמש בשמות העדכניים.
  • אל תאספו מידע אישי על אנשים, ובדקו את תנאי השימוש של האתר לפני כל איסוף בהיקף גדול.

תקלות נפוצות

Claude לא מצליח לפתוח דפדפן
שלבי הדפדפן דורשים את proxy-mcp. מתקינים אותו עם הפקודה מה-README שלו, מפעילים מחדש את Claude Code ובודקים עם /mcp שהשרת מחובר.
שמות הכלים בדפדפן לא תואמים
הסקיל נכתב לגרסה קודמת של proxy-mcp, ובגרסה 3 חלק מהכלים שינו שם (למשל interceptor_browser_launch במקום interceptor_chrome_launch). מבקשים מ-Claude להשתמש בשמות שהשרת מציג בפועל.
apify: command not found
מתקינים את הכלי עם npm install -g apify-cli, מתחברים עם apify login ומנסים שוב.
הסקיל לא נטען אחרי ההתקנה
בודקים שהתיקייה נקראת web-scraping ושקובץ SKILL.md נמצא ישירות בתוכה, ואז מפעילים מחדש את Claude Code.

שאלות ותשובות

האם מותר לאסוף נתונים מאתרים?
זה תלוי באתר ובשימוש. הסקיל נותן יכולת טכנית, אבל האחריות לבדוק את תנאי השימוש, את קובץ robots.txt ואת חוקי הפרטיות נשארת שלכם. במקרה של ספק, מבקשים אישור מבעל האתר.
האם זה עולה כסף?
הסקיל חינמי תחת רישיון MIT. הרצה בענן של Apify כרוכה בתמחור של Apify, ואם משתמשים בפרוקסי חיצוני, גם הוא בתשלום.
למה שם התיקייה web-scraping ולא web-scraper?
שם הריפו הוא web-scraper, אבל שם הסקיל בקובץ SKILL.md הוא web-scraping, ולכן ההתקנה כאן שומרת אותו בתיקייה בשם הזה, כמו במבנה שמופיע ב-README.
האם צריך לדעת לתכנת?
לסיור ולאיסוף חד-פעמי לא ממש, כי Claude כותב ומריץ את הקוד. להפעלה קבועה ב-Apify כדאי להכיר מעט את Node.js ואת TypeScript.
כמה פעיל הפרויקט?
נכון לספטמבר 2026 לריפו יש 95 כוכבים ב-GitHub, והעדכון האחרון נעשה ב-18 במרץ 2026. שרת ה-proxy-mcp של אותו מפתח מתעדכן בתדירות גבוהה יותר.

קרדיט ומקור. Web Scraper (web-scraping) נכתב על ידי yfe404 ונמצא ב-yfe404/web-scraper ברישיון MIT. את העמוד כתב קורן בן עזרא אחרי בדיקה של המאגר ושל פקודות ההתקנה (29.09.2026). מאגרים מתעדכנים, ולכן אם משהו השתנה, המאגר הוא המקור הקובע.

נתקעתם בהתקנה?

כתבו לי בוואטסאפ, אני קורא הכל ועונה.