🔥 AI 不再「读」网页,而是「看」网页了!伯克利团队开源神器 PixelRAG,颠覆你对搜索的认知
想象一下:你拍了一张课本上的表格照片,AI 直接「看懂」了照片里的内容,而不需要先把文字一个个敲出来。这就是今天要介绍的 PixelRAG 正在做的事——让 AI 像人一样「看」文档,而不是笨拙地「读」代码。
想象一下:你拍了一张课本上的表格照片,AI 直接「看懂」了照片里的内容,而不需要先把文字一个个敲出来。这就是今天要介绍的 PixelRAG 正在做的事——让 AI 像人一样「看」文档,而不是笨拙地「读」代码。
📖 先讲一个故事:AI「读」网页有多痛苦?
同学们,你们有没有这样的经历?
老师发了一份 PDF 试卷,上面有表格、有图表、有各种排版。你复制粘贴到 Word 里,结果——格式全乱了! 表格变成了一堆乱七八糟的文字,图表直接消失了。
其实,现在大部分 AI 搜索工具,每天都在经历同样的痛苦。
传统的 AI 搜索是这样工作的:
📄 网页/PDF → 🔧 解析成纯文字 → 🤖 AI 阅读文字 → 💬 回答问题
看起来很合理对吧?但问题是,第二步「解析成纯文字」的时候,大量信息丢失了!
- 精心设计的表格?→ 变成一堆乱码
- 漂亮的图表?→ 直接不见了
- 重要的排版布局?→ 面目全非
就好比你把一幅画「翻译」成文字描述,再让另一个人根据描述来理解这幅画——中间丢了多少信息啊!
💡 PixelRAG 的天才想法:不「读」了,直接「看」!
来自 UC Berkeley(加州大学伯克利分校) 的研究团队,想到了一个绝妙的主意:
既然解析文字会丢信息,那干脆不解析了!直接把网页截图,让 AI「看图」回答问题!
这就是 PixelRAG 的核心思路。简单到小学生都能理解:
| 传统方式 | PixelRAG 方式 |
|---|---|
| 📄 网页 → 提取文字 → AI 读文字 | 📄 网页 → 📸 截图 → AI 看图片 |
| ❌ 表格丢失 | ✅ 表格完好 |
| ❌ 图表消失 | ✅ 图表完好 |
| ❌ 布局错乱 | ✅ 排版完好 |
用一句话概括:PixelRAG 让 AI 用「眼睛」看文档,而不是用「翻译器」读文档。
它的口号也很霸气:
"网页解析的时代结束了。可扩展的像素原生搜索,开始了。"
📎 项目地址:https://github.com/StarTrail-org/PixelRAG(已获数千 ⭐ Star)
📎 在线体验:https://pixelrag.ai
🔍 PixelRAG 到底是怎么工作的?(四步搞懂)
别被「技术」两个字吓到,PixelRAG 的原理其实就像拍照 + 搜索相册,分四步:
第一步:📸「拍照」—— 把文档变成截图
PixelRAG 会把网页或 PDF 自动截图,切成一张张大小统一的"图片瓷砖"(tiles)。
就像你把一张长长的报纸,剪成一小块一小块,每块刚好是一屏的大小。
它用的是一个叫 Playwright 的工具来给网页截图——就像一个自动帮你截屏的小助手。
第二步:🧠「理解」—— AI 看懂每张截图
每张截图会被送进一个叫 Qwen3-VL 的视觉 AI 模型。这个模型会把每张图片「理解」成一串数字(叫做"向量"或"嵌入")。
你可以把它想象成:AI 给每张截图写了一段「内心独白」,记录了这张图里有什么内容、什么布局、什么图表。
第三步:📚「建索引」—— 把理解结果存起来
这些数字会被存到一个叫 FAISS 的高速搜索仓库里。
就像图书馆的目录卡片。有了目录,你就能快速找到想要的书,而不用一本本翻。
有多大规模呢?PixelRAG 团队已经把整个维基百科(828 万篇文章、约 2800 万张截图)都建好了索引!
第四步:🔎「搜索 + 回答」—— 找到最相关的截图,让 AI 看图回答
当你提问时,PixelRAG 会:
- 把你的问题也变成一串数字
- 在仓库里找到最相似的截图
- 把这些截图「喂」给 AI 大模型
- AI 直接看着截图 回答你的问题!
就像你问同学一道题,同学不是给你背课本原文,而是直接翻开书本,指着页面上的图表跟你讲解。看着原图讲,当然更准确!
📊 效果好不好?数据说话!
伯克利团队做了大量实验,结论很震撼:
在维基百科等测试中,PixelRAG(看图搜索)比传统方式(读文字搜索)最高提升了 18.1%!
特别是在这些场景下优势巨大:
- 📊 包含表格的问题 → 大幅领先
- 📈 包含图表的问题 → 大幅领先
- 🎨 包含复杂排版的问题 → 大幅领先
同时,因为不需要传入长长的文本,还能节省 AI 消耗的 token 成本(省钱!💰)。
🛠️ 手把手教你上手(超简单!)
🌐 方式一:在线体验(零门槛)
最简单的方式——什么都不用安装,直接打开:
🔗 https://pixelrag.ai
在搜索框输入问题(支持中文),甚至可以上传图片来搜索,立即体验"看图搜索"的魔力!
PixelRAG 还提供了免费的 API(不需要密钥):
🔗 https://api.pixelrag.ai
开发者可以直接调用,搜索整个维基百科。
💻 方式二:本地安装(进阶玩家)
如果你想在自己电脑上玩,也很简单:
第一步:安装
打开终端(命令行),输入:
pip install pixelrag
就这一行!装好了!
如果你需要更多功能,可以选装:
pip install 'pixelrag[index]' # 想自己建索引
pip install 'pixelrag[serve]' # 想自己开服务
pip install 'pixelrag[pdf]' # 想处理 PDF 文件
💡 小贴士:推荐用uv这个工具来安装,速度更快:uv tool install pixelrag
第二步:给网页截图
pixelshot https://example.com -o ./tiles
这条命令会自动打开网页、截图、切块,结果保存在 ./tiles 文件夹里。
PDF 也行哦!
第三步:建索引
pixelrag index build
它会自动把截图变成向量,存进搜索仓库。
第四步:开启搜索服务
pixelrag serve --index-dir ./my_index --port 30001
现在你就有了自己的"看图搜索引擎"!
第五步:搜索试试!
curl -X POST http://localhost:30001/search \
-H "Content-Type: application/json" \
-d '{"queries": [{"text": "你的问题"}], "n_docs": 5}'
或者用 Python 代码:
from pixelrag_render import render_url
# 一行代码,给网页截图
tiles = render_url("https://en.wikipedia.org/wiki/Python", "./tiles")
🤖 方式三:接入 Claude(AI 代理最佳搭档)
如果你在用 Claude(Anthropic 的 AI 助手),PixelRAG 有个专门的插件叫 PixelBrowse:
uv tool install pixelrag
然后在 Claude 的插件商店添加 StarTrail-org/PixelRAG,之后 Claude 就能直接「看」网页了——不再读 HTML 源代码,而是像人一样看截图!
⚙️ 配置文件长什么样?
PixelRAG 用一个简单的配置文件 pixelrag.yaml:
source:
type: local
path: ./my_docs # 你的文档目录
embed:
model: Qwen/Qwen3-VL-Embedding-2B
device: auto # 自动选择:GPU / Apple芯片 / CPU
output: ./my_index # 索引保存位置
是不是很简洁?改改路径就能用!
🎯 什么场景最适合用 PixelRAG?
✅ 非常推荐的场景
| 场景 | 为什么适合 |
|---|---|
| 📑 学术论文检索 | 论文里全是表格、公式、图表,传统方式解析一团糟 |
| 💼 财务报表分析 | 财报的表格排版极其复杂,截图看才准确 |
| 🌐 AI 浏览器助手 | 让 AI 代理「看」网页而不是「读」源码,准确率飙升 |
| 🖼️ 视觉搜索 | 用一张图搜索相似的图表、布局、设计 |
| 🏢 企业知识库 | 内部文档、历史存档,保留原始排版全文检索 |
| 📰 新闻/内容归档 | 新闻页面排版丰富,截图检索效果远超文字检索 |
❌ 不太推荐的场景
- 纯文字文档(比如小说、纯文字博客)→ 传统文字搜索更快更便宜
- 需要毫秒级响应的场景 → 截图 + 视觉理解有一定延迟(但可以优化)
👥 谁最适合用 PixelRAG?
- 🧑🔬 AI 研究者:探索多模态 RAG 的前沿,训练自己的视觉嵌入模型
- 👨💻 开发者:一行
pip install就能上手,CLI 工具链完整 - 🤖 AI 代理开发者:接入 Claude 等工具,打造更聪明的浏览器智能体
- 🏢 企业团队:处理海量 PDF 和网页存档,实现高保真检索
- 💻 开源爱好者:项目架构清晰(渲染、嵌入、服务三大模块分离),Apache-2.0 开源协议,欢迎贡献
⚠️ 使用前需要知道的事
说了这么多优点,也要诚实地说说局限:
1. 存储空间需求大
因为要存截图和向量索引,占用的磁盘空间比纯文字大很多。维基百科全量索引大约需要 217GB+ 的磁盘空间。
但如果只是处理自己的几十份文档,空间消耗是完全可接受的。
2. 速度比纯文字方式慢一些
毕竟多了"截图"和"视觉理解"两个步骤。不过项目文档里有专门的优化指南。
3. 需要一些硬件支持
- 小规模使用:普通电脑就行(Mac 的 Apple 芯片也 OK ✅)
- 大规模建索引:最好有 GPU
- 训练自定义模型:需要好显卡 + 大磁盘
4. 项目还在活跃开发中
最近的代码更新就在 2026 年 6 月,团队还在持续改进。建议关注 GitHub 获取最新动态。
🎬 总结:一个正在发生的「范式转变」
让我们最后回顾一下:
PixelRAG 代表了 AI 搜索从「读文字」到「看页面」的范式转变。
| 传统 RAG | PixelRAG | |
|---|---|---|
| 方式 | 解析文字 | 截图看图 |
| 表格 | ❌ 常丢失 | ✅ 完整保留 |
| 图表 | ❌ 常丢失 | ✅ 完整保留 |
| 布局 | ❌ 常错乱 | ✅ 完整保留 |
| 准确率 | 基准线 | 📈 最高提升 18.1% |
如果你经常处理包含表格、图表、复杂排版的文档,PixelRAG 值得你立即尝试。
最快的体验方式:
👉 打开 https://pixelrag.ai ,输入一个问题,感受「AI 看图搜索」的魔力!
📌 项目地址:https://github.com/StarTrail-org/PixelRAG
📌 在线体验:https://pixelrag.ai
📌 免费 API:https://api.pixelrag.ai
📌 论文:项目仓库 assets/pixelrag-paper.pdf
觉得有用?点个「在看」转发给你的朋友吧! 👇