Web Scraping & LLMs

DOM پارسنگ اور HTML صفائی: LLM ٹوکنز میں 90% کمی

فوری جواب: ڈاکومنٹ آبجیکٹ ماڈل (DOM) ٹری میں ان لائن SVG، CSS کلاسز اور اسکرپٹس کی وجہ سے 92% تک اضافی ٹوکنز ضائع ہوتے ہیں۔ lxml، Cheerio یا Tree-sitter جیسے html parser کے ذریعے غیر ضروری نوڈز ہٹا کر 85–92% token reduction html بچت حاصل ہوتی ہے، جس سے لاگت گھٹتی ہے اور RAG بہتر ہوتا ہے۔


1. تعارف: Document Object Model (DOM) کیا ہے اور کچا HTML ماڈلز کو کیوں متاثر کرتا ہے

خود مختار ویب براؤزنگ ایجنٹس اور RAG سسٹمز کے لیے کچا ویب مارک اپ سب سے بڑی رکاوٹ ہے۔ جب کوئی ایجنٹ کسی ویب پیج کو لوڈ کرتا ہے تو براؤزر رینڈرنگ انجن اس ڈیٹا کو میموری میں ایک درخت نما ڈھانچے میں تبدیل کرتا ہے جسے document object ٹری کہتے ہیں۔

Document Object Model (DOM) کیا ہے؟

ماڈلز کے لیے ویب ڈیٹا کو بہتر بنانے سے پہلے اس بنیادی ڈھانچے کو سمجھنا ضروری ہے: what is document object model dom؟

Document Object Model (DOM) ایک پلیٹ فارم سے آزاد پروگرامنگ انٹرفیس ہے جسے براؤزر انجن بناتے ہیں۔ جب HTML کوڈ موصول ہوتا ہے تو پارسر نوڈز کی درجہ بندی (Document $\rightarrow$ Element $\rightarrow$ Text) تیار کرتا ہے اور CSSOM کے ساتھ مل کر اسکرین پر لے آؤٹ بناتا ہے۔

براؤزر ٹوکنائزیشن اور Document Object Model (DOM) ٹری کی ساخت:
┌─────────────────────────────────────────────────────────────────────────────┐
│                            کچا نیٹ ورک بائٹ اسٹریم                          │
│                 <!DOCTYPE html><html lang="ur"><head>...                    │
└──────────────────────────────────────┬──────────────────────────────────────┘
                                       │ ٹوکنائزر (HTML5 پارسر الگورتھم)
                                       ▼
┌─────────────────────────────────────────────────────────────────────────────┐
│                             ٹوکن اسٹریم (Tokens)                            │
│       [StartTag: html] [StartTag: head] [StartTag: script] [EndTag: head]   │
└──────────────────────────────────────┬──────────────────────────────────────┘
                                       │ ٹری بلڈر (Tree Builder)
                                       ▼
┌─────────────────────────────────────────────────────────────────────────────┐
│                      Document Object Model (DOM) ٹری ڈھانچہ                 │
│                                 Document                                    │
│                                    │                                        │
│                                 <html>                                      │
│                  ┌─────────────────┴─────────────────┐                      │
│                <head>                              <body>                   │
│          ┌───────┴───────┐                   ┌───────┴───────┐              │
│       <title>         <script>             <header>        <main>           │
│          │               │                   │               │              │
│       "عنوان"       [ٹریکنگ JS]            <nav>         <article>          │
│                                              │               │              │
│                                           <ul>...      <p> "اصل مواد"       │
└─────────────────────────────────────────────────────────────────────────────┘

کچے DOM کے نقصانات:

  1. سیاق و سباق کا بے جا پھیلاؤ: عام ویب پیج میں 45,000 سے 120,000 ٹوکنز ہوتے ہیں، جن میں سے 85% سے 92% فضول ڈیٹا (SVG کوآرڈینیٹس، CSS، ٹریکرز) پر مشتمل ہوتا ہے۔
  2. توجہ کا بکھراؤ: 40,000 بیکار ٹوکنز کے نیچے اہم مواد دبنے سے ماڈل میں "Lost in the Middle" مسئلہ پیدا ہوتا ہے جس سے RAG کی کارکردگی 34% سے 48% گر جاتی ہے۔
  3. بھاری اخراجات: روزانہ 100,000 بغیر صفائی کے صفحات پروسیس کرنے سے ماہانہ $18,000 بل آ سکتا ہے، جو صفائی کے بعد $2,200 سے بھی کم رہ جاتا ہے۔

2. DOM کلیننگ کے 5 مراحل

  1. مرحلہ 1: بلیک لسٹ ٹیگز کا خاتمہ: