حالة استخدام · أدوات الكشط والزحف

اجمع البيانات الخام. غذي lean.

يحول LeanCTX الصفحات المجمعة إلى سياق جاهز للنموذج: يقوم ctx_url_read باستيعاب HTML وPDF وتغذيات RSS ونصوص YouTube، ويقوم بإزالة النصوص التمهيدية (boilerplate)، وإلغاء تكرار المحتوى عبر الصفحات، واستخراج الحقائق والاقتباسات. يظل الزاحف الخاص بك بسيطًا. تجعل طبقة السياق مخرجاته أصغر بنسبة 60-90% قبل أن يراها أي نموذج.

Same engine. Different workflow. Always the right context.

ما تكلفك اليوم.

البيانات الويب العشوائية تستنزف ميزانية التوكنز الخاصة بك

التنقل، وشارات ملفات تعريف الارتباط، والتذييلات، والإعلانات: معظم الصفحة المجمعة هو نصوص تمهيدية تدفع مقابل تضمينها وتدفع مرة أخرى لتضمينها في المطالبات.

تتضاعف التكرارات بصمت

يظهر نفس المقال على خمسة عناوين URL. بدون إزالة تكرار واعية بالمحتوى، تقوم بتخزينه ومعالجته خمس مرات.

التفريغ الخام غير قابل للبحث

مجلد من HTML المجمّع ليس قاعدة معرفة. يحتاج وكيلك إلى استرجاع مُرتب، وليس 10,000 ملف.

القدرات التي تقوم بالعمل.

كل ما يلي مُنشر في الثنائي مفتوح المصدر اليوم. لا عناصر خارطة طريق، ولا قوائم انتظار.

أدواتكLeanCTXالنموذج

الاستيعاب الشامل

يتعامل ctx_url_read مع HTML وملفات PDF وتغذيات RSS ونصوص YouTube

أوضاع الحقائق والاقتباسات

تنهار الصفحات إلى حقائق قابلة للإسناد واقتباسات حرفية

إلغاء التكرار

إزالة تكرار المحتوى عبر الهاش، وعبر الصفحات والجلسات وأدوات الكشط

BM25 + بحث بياني

يصبح كل ما يتم استيعابه قابلاً للبحث محليًا وتصنيفه

الأرشيف المحلي

تبقى المصادر الأصلية قابلة للاسترجاع؛ والضغط لا يمثل طريقاً مسدوداً أبدًا

من الصفر إلى أول مكسب.

terminal
# استيعاب صفحة كحقائق يمكن نسبها إلى مصدر معين$ ctx_url_read("https://example.com/article", mode="facts")
# استيعاب موجز؛ تصل العناصر بتاريخ وتخلو من التكرار$ ctx_url_read("https://news.site/feed.xml")
# البحث في كل ما قمت باستيعابه$ lean-ctx grep "quarterly revenue"
# استرجاع الأصل الكامل عند الحاجة$ ctx_retrieve(id)

الأسئلة التي تطرحها الفرق قبل التبني.

استعد السيطرة على سياقك.

مجاني للاستخدام المحلي، إلى الأبد. يفرض CI ذلك. ثنائي واحد، وعشر دقائق لأول مكسب مُقاس.

Support this project