AI Architecture

AI এজেন্ট এবং Agentic RAG-এর জন্য উন্নত ওয়েব সার্চ অপারেটর

দ্রুত উত্তর: উন্নত সার্চ অপারেটর (site:, filetype:, inurl:, intitle:, বুলিয়ান লজিক) স্বায়ত্তশাসিত AI এজেন্ট এবং RAG পাইপলাইনকে নির্ভুল তথ্য ইঞ্জিনে রূপান্তর করে। ডোমেন সীমা নির্ধারণ, সঠিক ফাইল ফরম্যাট পৃথকীকরণ এবং URL পাথ ফিল্টারিংয়ের মাধ্যমে এজেন্টরা ওয়েব হ্যালুসিনেশন ও বিজ্ঞাপনী স্প্যাম দূর করে এবং টোকেন খরচ ৮২% পর্যন্ত কমায়।

১. ভূমিকা: সাধারণ ওয়েব অনুসন্ধানে স্বায়ত্তশাসিত AI এজেন্টরা কেন ব্যর্থ হয়

২০২৬ সালে, স্বায়ত্তশাসিত AI রিসার্চ এজেন্টদের (কোডিং অ্যাসিস্ট্যান্ট যেমন Claude Code, Devin এবং মাল্টি-এজেন্ট ফ্রেমওয়ার্ক যেমন LangGraph, CrewAI) কার্যকারিতা মূলত মডেলের যুক্তি ক্ষমতার চেয়ে তথ্য পুনরুদ্ধার গ্রাউন্ডিংয়ের (Retrieval Grounding) গুণমানের ওপর বেশি নির্ভরশীল।

একটি এজেন্ট যখন সাধারণ প্রাকৃতিক ভাষার কোয়েরি (যেমন "how to configure mutual TLS in Envoy proxy") সরাসরি বাণিজ্যিক সার্চ API-তে পাঠায়, তখন এটি মারাত্মক সিগন্যাল-টু-নয়েজ অনুপাতের সংকটে পড়ে:

[এজেন্টের সাধারণ প্রাকৃতিক ভাষা কোয়েরি]
         │
         ▼
[প্রচলিত SERP API (Google / Bing / Brave)]
         │
         ├─► ফলাফল ১: কোনো কোড ছাড়া ৪৫ কিলোবাইটের মার্কেটিং ল্যান্ডিং পেজ
         ├─► ফলাফল ২: ২০২১ সালের মিডিয়াম ব্লগ যাতে পুরনো অপ্রচলিত API রয়েছে
         ├─► ফলাফল ৩: ভুল StackOverflow উত্তর সমৃদ্ধ SEO স্প্যাম ফার্ম
         └─► ফলাফল ৪: কনফিগারেশন স্কিমা ছাড়া সাধারণ গিটহাব টেমপ্লেট README
         │
         ▼
[হেডলেস ব্রাউজার স্ক্র্যাপিং + DOM রূপান্তর]
         │
         ▼
[৩৫,০০০ টোকেন HTML, কুকি ব্যানার ও স্ক্রিপ্ট LLM কনটেক্সটে জমা]
         │
         ▼
[LLM ফলাফল: মারাত্মক হ্যালুসিনেশন, তথ্য বাদ পড়া, সার্চ প্রতি $০.১৮ ডলার অপচয়]

অনিয়ন্ত্রিত প্রাকৃতিক ভাষার অনুসন্ধানে রিকল বেশি হলেও প্রিসিশন অত্যন্ত দুর্বল। বাণিজ্যিক সার্চ ইঞ্জিনগুলো মানুষের ক্লিক ও ডোমেন কর্তৃত্বকে প্রাধান্য দেয়, মেশিনের জন্য প্রয়োজনীয় প্রযুক্তিগত তথ্যকে নয়।

এই ধরনের অনুসন্ধানের ফলে তিনটি বড় ঝুঁকি তৈরি হয়:

  1. কনটেক্সট উইন্ডো দূষণ: হাজার হাজার অপ্রয়োজনীয় কোড আসল টেকনিক্যাল ডকুমেন্টেশনকে ঢেকে ফেলে।
  2. সময়গত ও অর্থগত হ্যালুসিনেশন: প্রথম দিকের লিংকগুলোকে সত্য ধরে নিয়ে মডেল অপ্রচলিত কোড তৈরি করে।
  3. অর্থনৈতিক টোকেন অপচয়: ১০ থেকে ৩০টি সার্চ ধাপের এজেন্ট ওয়ার্কফ্লো প্রতি কাজে $৩.০০ ডলারের বেশি টোকেন নষ্ট করে এবং ৩ থেকে ৯ সেকেন্ড পর্যন্ত বিলম্ব ঘটায়।

এন্টারপ্রাইজ-মানের Agentic RAG তৈরির জন্য সার্চ ইঞ্জিনকে কাঠামোগত ডাটাবেস হিসেবে ব্যবহার করতে হবে। উন্নত ওয়েব সার্চ অপারেটর (site:, filetype:, inurl:, intitle:, বুলিয়ান লজিক এবং ext:asp inurl:search-এর মতো প্যাটার্ন) ব্যবহার করে এজেন্টরা এইচটিএমএল ডাউনলোড করার আগেই ৯৫% আবর্জনা বাদ দিতে পারে।


২. AI এজেন্টদের জন্য সার্চ অপারেটরের শ্রেণিবিন্যাস

+---------------------------------------------------------------------------------------------------------+
|                                        সার্চ ইঞ্জিন অপারেটর ম্যাট্রিক্স                                 |
+-------------------+-----------------------------+-----------------------------+-------------------------+
| অপারেটর ক্যাটাগরি | সিনট্যাক্স প্যাটার্ন         | ইনডেক্স প্রুনিং লক্ষ্য      | Agentic RAG-এ উপযোগিতা  |
+-------------------+-----------------------------+-----------------------------+-------------------------+
| ডোমেন সীমাবদ্ধতা  | site:domain.com             | হোস্টনেম / FQDN B-Tree      | কেবল অফিসিয়াল ডকুমেন্ট  |
| TLD টার্গেটিং     | site:.gov, site:.edu        | শীর্ষ স্তরের ডোমেন বিভাজন   | নিয়ন্ত্রক ও একাডেমিক     |
| ফাইল ফরম্যাট পৃথক | filetype:pdf, ext:json      | MIME / Content-Type ইনডেক্স | স্কিমা এবং হোয়াইটপেপার  |
| URI পাথ টোকেন     | inurl:api, inurl:v1         | পাথ লেক্সিক্যাল ইনডেক্স     | API এন্ডপয়েন্ট আবিষ্কার|
| পাতার শিরোনাম মিল | intitle:"Index of /"        | <title> মেটাডাটা ট্যাগ      | রিপোজিটরি ও স্পেসিফিকেশন|
| হুবহু বাক্যাংশ    | "exact error string"        | পজিশনাল N-Gram ইনডেক্স      | সঠিক বাগ রিপ্রোডাকশন   |
| নেতিবাচক ফিল্টার   | -inurl:blog -site:pinterest | পোস্টিং লিস্ট বিয়োগ        | এসইও স্প্যাম সম্পূর্ণ দূর|
| বুলিয়ান লজিক     | (A OR B) AND (C NOT D)      | সংযোজন ও বিয়োজনের কাজ      | বহু-সংস্করণ অনুসন্ধান   |
+-------------------+-----------------------------+-----------------------------+-------------------------+

৩. সার্চ ইঞ্জিন তুলনা: Google vs Bing vs Brave vs Tavily

+-----------------------------------------------------------------------------------------------------------------+
|                                 সার্চ ইঞ্জিন সক্ষমতা ও লেটেন্সি তুলনা ম্যাট্রিক্স                               |
+--------------------+----------------------+----------------------+---------------------+------------------------+
| অপারেটর / ফিচার    | Google Search API    | Bing Web Search API  | Brave Search API    | Tavily / Exa (AI Nat)  |
+--------------------+----------------------+----------------------+---------------------+------------------------+
| site: / -site:     | সম্পূর্ণ (সাবডোমেনসহ)| সম্পূর্ণ (সাবডোমেনসহ)| সম্পূর্ণ (সাবডোমেনসহ)| নেটিভ REST প্যারামিটার |
| filetype: / ext:   | ২০টির বেশি ফরম্যাট   | ১২টির বেশি ফরম্যাট   | বেসিক (PDF/Doc)     | include_domains বিকল্প |
| inurl: / allinurl: | সম্পূর্ণ              | আংশিক                | সম্পূর্ণ              | সেমান্টিক ফিল্টার      |
| intitle: / allin:  | সম্পূর্ণ              | সম্পূর্ণ              | সম্পূর্ণ              | সেমান্টিক ফিল্টার      |
| মাইনাস অপারেটর (-) | সম্পূর্ণ              | সম্পূর্ণ              | সম্পূর্ণ              | exclude_domains বিকল্প |
| বুলিয়ান OR / |     | সম্পূর্ণ              | বড় হাতের OR আবশ্যক  | সম্পূর্ণ              | অন্তর্নিহিত সেমান্টিক   |
| সর্বোচ্চ দৈর্ঘ্য    | ৩২ শব্দ / ২০৪৮ অক্ষর | ১০০০ অক্ষর           | ৫০০ অক্ষর / ২৫ টোকেন| ৪০০ টোকেন (প্রাকৃতিক) |
| P50 লেটেন্সি (REST)| ৬৫০ - ১২০০ মি.সে.    | ৪৫০ - ৮০০ মি.সে.     | ১৮০ - ৩৫০ মি.সে.    | ৪৫০ - ৭৫০ মি.সে.       |
| খরচ / ১০০০ রিকোয়েস্ট| $৫.০০ (SerpAPI মারফত)| $৩.০০ - $৭.০০        | $৩.০০ - $৫.০০       | $৮.০০ (Tavily অ্যাডভান্স)|
+--------------------+----------------------+----------------------+---------------------+------------------------+

৪. এজেন্ট কোয়েরি কম্পাইলার আর্কিটেকচার

সিস্টেম ব্যবহারকারীর প্রম্পট সরাসরি পাঠায় না, বরং একটি মাল্টি-স্টেজ কোয়েরি কম্পাইলার (Multi-Stage Query Compiler) ব্যবহার করে:

[ব্যবহারকারীর প্রম্পট / এজেন্টের কাজ]
                  │
                  ▼
     [ধাপ ১: উদ্দেশ্য বিশ্লেষণ ও সত্তা নিষ্কাশন]
                  │
                  ▼
     [ধাপ ২: সুনির্দিষ্ট অপারেটর সংশ্লেষণ (site:, inurl:)]
                  │
                  ▼
     [ধাপ ৩: সার্চ ইঞ্জিন উপযোগী সিনট্যাক্স রূপান্তর]
                  │
                  ▼
     [ধাপ ৪: এক্সিকিউশন ও শর্ত শিথিলকরণ স্টেট মেশিন]

৫. পাইথনে প্রোডাকশন কোড বাস্তবায়ন

import httpx
from pydantic import BaseModel, Field
from typing import List, Dict, Any
from enum import Enum


class SearchConstraint(BaseModel):
    query: str = Field(..., description="মূল কিওয়ার্ড")
    target_domains: List[str] = Field(default_factory=list, description="site: ডোমেন তালিকা")
    excluded_domains: List[str] = Field(default_factory=list, description="-site: বাদ দেওয়া ডোমেন")
    file_extensions: List[str] = Field(default_factory=list, description="filetype: এক্সটেনশন")
    url_keywords: List[str] = Field(default_factory=list, description="inurl: পাথ কিওয়ার্ড")
    excluded_url_keywords: List[str] = Field(default_factory=list, description="-inurl: বাদ দেওয়া পাথ")
    exact_phrases: List[str] = Field(default_factory=list, description="উদ্ধৃতি চিহ্নে হুবহু বাক্যাংশ")
    title_keywords: List[str] = Field(default_factory=list, description="intitle: শিরোনাম কিওয়ার্ড")


class AgentQueryCompiler:
    """কাঠামোগত শর্তসমূহকে অপ্টিমাইজড কোয়েরি স্ট্রিংয়ে রূপান্তর করে।"""

    @staticmethod
    def compile_lexical_query(constraint: SearchConstraint) -> str:
        tokens: List[str] = []

        for phrase in constraint.exact_phrases:
            cleaned = phrase.replace('"', '').strip()
            if cleaned:
                tokens.append(f'"{cleaned}"')

        if constraint.query.strip():
            tokens.append(constraint.query.strip())

        if constraint.target_domains:
            if len(constraint.target_domains) == 1:
                tokens.append(f"site:{constraint.target_domains[0]}")
            else:
                sites = " OR ".join([f"site:{d}" for d in constraint.target_domains])
                tokens.append(f"({sites})")

        for ex in constraint.excluded_domains:
            tokens.append(f"-site:{ex}")

        if constraint.file_extensions:
            if len(constraint.file_extensions) == 1:
                tokens.append(f"filetype:{constraint.file_extensions[0]}")
            else:
                exts = " OR ".join([f"filetype:{e}" for e in constraint.file_extensions])
                tokens.append(f"({exts})")

        for kw in constraint.url_keywords:
            tokens.append(f"inurl:{kw}")
        for ex_kw in constraint.excluded_url_keywords:
            tokens.append(f"-inurl:{ex_kw}")

        for t in constraint.title_keywords:
            tokens.append(f"intitle:{t}")

        return " ".join(tokens)

৬. বেঞ্চমার্ক এবং বাস্তব কেস স্টাডি

৫০০টি এজেন্ট রিসার্চ কাজের ওপর সাধারণ সার্চ ও অপারেটরভিত্তিক সার্চের তুলনা:

+-------------------------------------------------------------------------------------------------------------+
|                               বেঞ্চমার্ক: সাধারণ অনুসন্ধান বনাম অপারেটর অনুসন্ধান                            |
+------------------------------+--------------------+------------------------+------------------+-------------+
| কাজের ক্ষেত্র                | সার্চ পদ্ধতি       | টোকেন অপচয়            | Precision@5 প্রিস| লেটেন্সি P95|
+------------------------------+--------------------+------------------------+------------------+-------------+
| ডিস্ট্রিবিউটেড সিস্টেম ডিবাগিং| সাধারণ টেক্সট সার্চ| ৪৮,২০০ টোকেন ($০.২৪)   | ১৮.৪%            | ৮,৪২০ মি.সে.|
| ডিস্ট্রিবিউটেড সিস্টেম ডিবাগিং| অপারেটর সার্চ      | ৮,৬০০ টোকেন  ($০.০৪)   | ৯৪.২%            | ১,৪৮০ মি.সে.|
| SEC 10-K আর্থিক নিরীক্ষা     | সাধারণ টেক্সট সার্চ| ৬৪,১০০ টোকেন ($০.৩২)   | ২৪.১%            | ৯,৮০০ মি.সে.|
| SEC 10-K আর্থিক নিরীক্ষা     | অপারেটর সার্চ      | ১১,২০০ টোকেন ($০.০৫)   | ৯৮.৬%            | ২,১০০ মি.সে.|
| অপ্রকাশিত API এন্ডপয়েন্ট খোঁজ | সাধারণ টেক্সট সার্চ| ৩৯,৫০০ টোকেন ($০.১৯)   | ১২.০%            | ৭,২০০ মি.সে.|
| অপ্রকাশিত API এন্ডপয়েন্ট খোঁজ | অপারেটর সার্চ      | ৫,৪০০ টোকেন  ($০.০২)   | ৯১.৫%            | ১,১২০ মি.সে.|
+------------------------------+--------------------+------------------------+------------------+-------------+

৭. অ্যান্টি-স্ক্র্যাপিং ও রেট লিমিট সুরক্ষা

উচ্চ হারে অনুসন্ধানের ক্ষেত্রে Cloudflare Turnstile বা DataDome-এর বাধা এড়াতে হেডলেস ব্রাউজারের বদলে ম্যানেজড API (Brave Search API বা Tavily) ব্যবহার করাই শ্রেয়। এটি রেসিডেন্সিয়াল প্রক্সি এবং TLS ফিঙ্গারপ্রিন্টিং স্বচ্ছভাবে পরিচালনা করে।


৮. খরচ বিশ্লেষণ এবং বার্ষিক ROI

প্রতি বছর ১০০,০০০টি রিসার্চ টাস্কের বার্ষিক খরচের হিসাব:

+------------------------------------------------------------------------------------------------------------+
|                               বার্ষিক খরচ মডেল: ১০০,০০০টি এজেন্ট রিসার্চ কাজ                                |
+------------------------------------+-----------------------------------+-----------------------------------+
| খরচের খাত                          | সাধারণ সার্চ আর্কিটেকচার          | অপারেটর চালিত সার্চ আর্কিটেকচার   |
+------------------------------------+-----------------------------------+-----------------------------------+
| কাজ প্রতি গড় সার্চ                | ৮.৪টি কোয়েরি (বারংবার চেষ্টা)    | ২.১টি কোয়েরি (সুনির্দিষ্ট ফলাফল)|
| সার্চ API খরচ (@$৪.০০/১k)          | $৩,৩৬০                            | $৮৪০                              |
| ইনপুট কনটেক্সট টোকেন               | ২৯.৪ বিলিয়ন টোকেন                | ৮৮২ মিলিয়ন টোকেন                 |
| LLM ইনফারেন্স খরচ (@$৩.০০/১M)      | $৮৮,২০০                           | $২,৬৪৬                            |
| প্রক্সি ও ব্যান্ডউইথ খরচ           | $৪,৫০০                            | $৬৫০                              |
+------------------------------------+-----------------------------------+-----------------------------------+
| মোট বার্ষিক পরিচালনা ব্যয়          | $৯৬,০৬০                           | $৪,১৩৬                            |
| মোট বার্ষিক সঞ্চয়                 | বেসলাইন                           | $৯১,৯২৪ (৯৫.৭% খরচ হ্রাস)         |
+------------------------------------+-----------------------------------+-----------------------------------+

৯. উপসংহার

স্বায়ত্তশাসিত AI এজেন্টের সাফল্য নির্ভর করে তথ্যের মূল উৎসের সত্যতার ওপর। কাঠামোগত সার্চ অপারেটর (site:, filetype:, inurl:, intitle: এবং ext:asp inurl:search) ব্যবহার করে হ্যালুসিনেশন দূর করা যায় এবং প্রোডাকশন স্তরে এন্টারপ্রাইজ Agentic RAG নিশ্চিত করা সম্ভব হয়।

← সব নিবন্ধ
0 / 4