用例 · 爬虫与抓取器

抓取原始数据。 为模型提供优质上下文。

LeanCTX 将抓取的页面转换为模型就绪的上下文:ctx_url_read 摄取 HTML、PDF、RSS 和 YouTube 文稿,去除样板代码,跨页面去重并提取事实和引文。您的爬虫保持简单。在任何模型看到它之前,上下文层可将其输出缩小 60–90%。

Same engine. Different workflow. Always the right context.

它让您损失了什么 今天。

网络垃圾消耗你的 Token 配额

导航栏、Cookie 横幅、页脚、广告:大部分抓取的页面都是样板代码,您需要为此支付嵌入费用,并再次为提示词付费。

重复内容悄然增殖

同一篇文章出现在五个 URL 上。如果没有内容感知的去重,您将存储和处理它五次。

原始数据无法搜索

一个包含抓取 HTML 的文件夹不是知识库。您的智能体需要排名检索,而不是 10,000 个文件。

具备能力的那些 完成工作。

下方所有功能都已在开源二进制文件中交付。没有路线图项目,没有等待列表。

您的工具LeanCTX模型

通用摄取

ctx_url_read 处理 HTML、PDF、RSS 源和 YouTube 文稿

事实与引文模式

页面折叠为可归属的事实和逐字引文

去重

跨页面、会话和抓取任务的内容哈希去重

BM25 + 图谱搜索

所有摄入的数据都可本地搜索和排名

本地存档

原始内容可检索;压缩绝非死胡同

从零开始到 第一个收益。

terminal
# 摄取可归因的事实页面$ ctx_url_read("https://example.com/article", mode="facts")
# 摄取信息流;项目按日期到达并去重$ ctx_url_read("https://news.site/feed.xml")
# 搜索所有已摄取的内容$ lean-ctx grep "quarterly revenue"
# 在需要时检索完整的原始页面$ ctx_retrieve(id)

团队在采用前提出的问题。

重新掌控你的上下文。

本地使用免费,永久免费。CI强制执行它。一个二进制文件,十分钟即可获得第一个可衡量收益。

Support this project