هل الـ web scraping شئ قانوني ؟

السلام عليكم

اليوم قرأت بعض المدونات عن موضوع الـ web scraping وال ذي يعني حرفياً تجريف الويب ، أما تقنياً فيعني :

فتح صفحات موقع ما و قراءة تفاصيل هذه الصفحة بحيث تستخرج بيانات يتم الاستفادة منها لاحقاً .

كأقرب مثال من الممكن لأحد المطورين أن يقوم بتطوير web scrapper لقراءة صفحات موقع حسوب io ثم يقوم بتكوين بيانات كـ Rest API للإستفادة منها في أي تطبيق أخر مثل تطبيق هاتف جوال كمثال ، أو حتى جمع بعض المعلومات عن المجتمع لعمل إحصائية في رسومات بيانية .

  • أكرر هل هذه العملية قانونية أم لا ؟

  • و ما هي تبعاتها على الموقع ؟ أو حتى من ينفذها ؟

تحياتي

يرجى الدخول لحسابك أو تسجيل حساب لتستطيع إضافة تعليق
حساب جديد دخول

التعليقات

الأمر يعتمد على الموقع ورخصة الاستخدام، ويكيبيدا مثلا، المحتوى متاح تحت رخصة المشاع الإبداعي لذلك يمكنك جلب المحتوى ببساطة

كذلك arabia المحتوى (الذي يكتبه الأعضاء) تحت رخصة المشاع الإبداعي لذلك مسموح لك بالحصول عليه

مواقع أخرى ستسمح لك بالحصول على المحتوى ولكن للاستخدام الشخصي فحسب، مثلا من أجل إحصائيات وليس من أجل إعادة النشر

يعني من الممكن أن "أجرف صفحات حسوب io شبر شبر ، موضوع موضوع ، تعليق تعليق ، زنقه زنقه" ^_^ ، و أستخدم البيانات كيفما أشاء ؟

assassinateur أضف ردا

بالطبع،

في الواقع في المدة الآخير قام @mustafaihssan بالقيام بهذا (استغرق منه ساعات طويلة) وقام بتحليل البيانات، وجلب أكثر الجمل المتكررة

اجل و احب ان اضيف لكلام @assassinateur

تستطيع ان استعمالها للإمور الشخصية و الاكادمية او تحت الاستعمال العادل حتي لو كانت بحقوق ملكية.

و لكن نشر تلك المعلومات خام هو الممنوع ان كانت الرخصة تمنع هذا، مثلا حملت ملايين من صور الانستجرام المحمية و لكنك قمت بعمل شيء يغير من محتواها مثل college عملاق او تدخلها في برنامج ذكاء صناعي فهو امر عادي، أما اذا تريد نشر المعلومات خام مثل قاعدة بيانات بكافة المعلومات فيحق لك ذالك فقط لو سمحت لك الرخصة او المالك، انا حاليا اقرأ بحث علمي من جوجل و فيه استخدمت صور محملة من انستجرام و فلكر و لكن لم تنشر هذه الصور بل نشرت فقط ناتج الصور، و ايضا هناك Dataset لصور كثيرة تستخدم لتدريب برامج الرؤية الحاسوبية و لكي يتمكنوا من نشرها استعملوا فقط التي هي من رخصة مشاع.


tl;dr - تعتمد على ما تنشر و كيفية نشره

شكراً على التوضيح .

و لكن بما أنك مررت بنفس التجربة التي أو أود أن مر بها ، فلدي بضعة أسئلة :

  • ما المدة التي إستقرتها عملية الـ scraping التي قمت بها ؟

  • و ما هي الادوات التي إستخدمتها لفعل ذلك ؟

  • و أي المراحل أصعب ؟

    • مرحلة جلب الصفحات ؟ ( و ما يترتب عليها من إيقاف api rate limits ) ؟
    • أم مرحلة تحليل الصفحات التي تم جلبها ؟

بالنسبة لموضوع إعادة نشر المعلومات ، ولو كانت البيانات تحت رخصة توفر طلبها ، فهل إعادة عرض هذه البيانات مره خرى قد يسبب ضرر للشركة الراعية الاساسية ؟

سلامي

ما المدة التي إستقرتها عملية الـ scraping التي قمت بها ؟

اخذت 13 ساعة على انترنيت سريع جدا

و ما هي الادوات التي إستخدمتها لفعل ذلك ؟

البايثون

و أي المراحل أصعب ؟

سحب البيانات (HTML) سهل، الصعب هو Parse المعلومات للحصول على بيانات نظيفة

رحلة جلب الصفحات ؟ ( و ما يترتب عليها من إيقاف api rate limits ) ؟

لم يحدث شيء، لأن البرنامج يعمل على هئية متصفح و لا يستعمل API

لو انه يوجد API لكان الامر اسهل و لكنت صحلت علي بيانات اكثر دقة و قد استطيع ان ازود بمعلومات غير مرئية، مثل عدد الكلي للتقييمات الاجابية من دون طرح السلبية منها، مع الوقت لكل تقييم.

فهل إعادة عرض هذه البيانات مره خرى قد يسبب ضرر للشركة الراعية الاساسية ؟

أنه يعتمد على الموقع

سحب البيانات (HTML) سهل، الصعب هو Parse المعلومات للحصول على بيانات نظيفة

هل لأن التطبيق يستخدم ألية تطبيق الصفحة الواحدة (spa) أو ما يشابهها ؟ أم ببساطة ألية العرض البيانات كـ HTML تختلف من متصفح لأخر ؟

شكراً على المعلومات المفيدة .

هو يقصد إستخراج المعلومات التي تهمه من ال html لأنك عندما ترسل طلب request ستحصل على html على شكل سلسلة نصية string

نعم أعرف لذلك و لكن التطبيقات التي تعتمد على الـ JavaScript كثيراً من جانب المتصفح تصعب عملية الطلب لأن الناتج تحديث بسيط على الصفحة وليس مجرد جلب لصفحة HTML كامله

لم أجرب الأمر لكن يمكنك إستخدام wrapper مثل phantomJS لهذه الحالة

فكرة في الموضوع فعلاً ^_^