9 分钟

🔥 AI 不再「读」网页,而是「看」网页了!伯克利团队开源神器 PixelRAG,颠覆你对搜索的认知

想象一下:你拍了一张课本上的表格照片,AI 直接「看懂」了照片里的内容,而不需要先把文字一个个敲出来。这就是今天要介绍的 PixelRAG 正在做的事——让 AI 像人一样「看」文档,而不是笨拙地「读」代码。

github #github / pixelrag / RAG / 索引 / 搜索 / 知识库

想象一下:你拍了一张课本上的表格照片,AI 直接「看懂」了照片里的内容,而不需要先把文字一个个敲出来。这就是今天要介绍的 PixelRAG 正在做的事——让 AI 像人一样「看」文档,而不是笨拙地「读」代码。

📖 先讲一个故事:AI「读」网页有多痛苦?

同学们,你们有没有这样的经历?

老师发了一份 PDF 试卷,上面有表格、有图表、有各种排版。你复制粘贴到 Word 里,结果——格式全乱了! 表格变成了一堆乱七八糟的文字,图表直接消失了。

其实,现在大部分 AI 搜索工具,每天都在经历同样的痛苦。

传统的 AI 搜索是这样工作的:

📄 网页/PDF → 🔧 解析成纯文字 → 🤖 AI 阅读文字 → 💬 回答问题

看起来很合理对吧?但问题是,第二步「解析成纯文字」的时候,大量信息丢失了!

  • 精心设计的表格?→ 变成一堆乱码
  • 漂亮的图表?→ 直接不见了
  • 重要的排版布局?→ 面目全非

就好比你把一幅画「翻译」成文字描述,再让另一个人根据描述来理解这幅画——中间丢了多少信息啊!


💡 PixelRAG 的天才想法:不「读」了,直接「看」!

来自 UC Berkeley(加州大学伯克利分校) 的研究团队,想到了一个绝妙的主意:

既然解析文字会丢信息,那干脆不解析了!直接把网页截图,让 AI「看图」回答问题!

这就是 PixelRAG 的核心思路。简单到小学生都能理解:

传统方式 PixelRAG 方式
📄 网页 → 提取文字 → AI 读文字 📄 网页 → 📸 截图 → AI 看图片
❌ 表格丢失 ✅ 表格完好
❌ 图表消失 ✅ 图表完好
❌ 布局错乱 ✅ 排版完好

用一句话概括:PixelRAG 让 AI 用「眼睛」看文档,而不是用「翻译器」读文档。

它的口号也很霸气:

"网页解析的时代结束了。可扩展的像素原生搜索,开始了。"

📎 项目地址:https://github.com/StarTrail-org/PixelRAG(已获数千 ⭐ Star)

📎 在线体验:https://pixelrag.ai


🔍 PixelRAG 到底是怎么工作的?(四步搞懂)

别被「技术」两个字吓到,PixelRAG 的原理其实就像拍照 + 搜索相册,分四步:

第一步:📸「拍照」—— 把文档变成截图

PixelRAG 会把网页或 PDF 自动截图,切成一张张大小统一的"图片瓷砖"(tiles)。

就像你把一张长长的报纸,剪成一小块一小块,每块刚好是一屏的大小。

它用的是一个叫 Playwright 的工具来给网页截图——就像一个自动帮你截屏的小助手。

第二步:🧠「理解」—— AI 看懂每张截图

每张截图会被送进一个叫 Qwen3-VL 的视觉 AI 模型。这个模型会把每张图片「理解」成一串数字(叫做"向量"或"嵌入")。

你可以把它想象成:AI 给每张截图写了一段「内心独白」,记录了这张图里有什么内容、什么布局、什么图表。

第三步:📚「建索引」—— 把理解结果存起来

这些数字会被存到一个叫 FAISS 的高速搜索仓库里。

就像图书馆的目录卡片。有了目录,你就能快速找到想要的书,而不用一本本翻。

有多大规模呢?PixelRAG 团队已经把整个维基百科(828 万篇文章、约 2800 万张截图)都建好了索引!

第四步:🔎「搜索 + 回答」—— 找到最相关的截图,让 AI 看图回答

当你提问时,PixelRAG 会:

  1. 把你的问题也变成一串数字
  2. 在仓库里找到最相似的截图
  3. 把这些截图「喂」给 AI 大模型
  4. AI 直接看着截图 回答你的问题!
就像你问同学一道题,同学不是给你背课本原文,而是直接翻开书本,指着页面上的图表跟你讲解。看着原图讲,当然更准确!

📊 效果好不好?数据说话!

伯克利团队做了大量实验,结论很震撼:

在维基百科等测试中,PixelRAG(看图搜索)比传统方式(读文字搜索)最高提升了 18.1%!

特别是在这些场景下优势巨大:

  • 📊 包含表格的问题 → 大幅领先
  • 📈 包含图表的问题 → 大幅领先
  • 🎨 包含复杂排版的问题 → 大幅领先

同时,因为不需要传入长长的文本,还能节省 AI 消耗的 token 成本(省钱!💰)。


🛠️ 手把手教你上手(超简单!)

🌐 方式一:在线体验(零门槛)

最简单的方式——什么都不用安装,直接打开:

🔗 https://pixelrag.ai

在搜索框输入问题(支持中文),甚至可以上传图片来搜索,立即体验"看图搜索"的魔力!

PixelRAG 还提供了免费的 API(不需要密钥):

🔗 https://api.pixelrag.ai

开发者可以直接调用,搜索整个维基百科。


💻 方式二:本地安装(进阶玩家)

如果你想在自己电脑上玩,也很简单:

第一步:安装

打开终端(命令行),输入:

pip install pixelrag

就这一行!装好了!

如果你需要更多功能,可以选装:

pip install 'pixelrag[index]'  # 想自己建索引
pip install 'pixelrag[serve]'  # 想自己开服务
pip install 'pixelrag[pdf]'    # 想处理 PDF 文件
💡 小贴士:推荐用 uv 这个工具来安装,速度更快:uv tool install pixelrag

第二步:给网页截图

pixelshot https://example.com -o ./tiles

这条命令会自动打开网页、截图、切块,结果保存在 ./tiles 文件夹里。

PDF 也行哦!

第三步:建索引

pixelrag index build

它会自动把截图变成向量,存进搜索仓库。

第四步:开启搜索服务

pixelrag serve --index-dir ./my_index --port 30001

现在你就有了自己的"看图搜索引擎"!

第五步:搜索试试!

curl -X POST http://localhost:30001/search \
  -H "Content-Type: application/json" \
  -d '{"queries": [{"text": "你的问题"}], "n_docs": 5}'

或者用 Python 代码:

from pixelrag_render import render_url

# 一行代码,给网页截图
tiles = render_url("https://en.wikipedia.org/wiki/Python", "./tiles")

🤖 方式三:接入 Claude(AI 代理最佳搭档)

如果你在用 Claude(Anthropic 的 AI 助手),PixelRAG 有个专门的插件叫 PixelBrowse

uv tool install pixelrag

然后在 Claude 的插件商店添加 StarTrail-org/PixelRAG,之后 Claude 就能直接「看」网页了——不再读 HTML 源代码,而是像人一样看截图!


⚙️ 配置文件长什么样?

PixelRAG 用一个简单的配置文件 pixelrag.yaml

source:
  type: local
  path: ./my_docs  # 你的文档目录

embed:
  model: Qwen/Qwen3-VL-Embedding-2B
  device: auto  # 自动选择:GPU / Apple芯片 / CPU

output: ./my_index  # 索引保存位置

是不是很简洁?改改路径就能用!


🎯 什么场景最适合用 PixelRAG?

✅ 非常推荐的场景

场景 为什么适合
📑 学术论文检索 论文里全是表格、公式、图表,传统方式解析一团糟
💼 财务报表分析 财报的表格排版极其复杂,截图看才准确
🌐 AI 浏览器助手 让 AI 代理「看」网页而不是「读」源码,准确率飙升
🖼️ 视觉搜索 用一张图搜索相似的图表、布局、设计
🏢 企业知识库 内部文档、历史存档,保留原始排版全文检索
📰 新闻/内容归档 新闻页面排版丰富,截图检索效果远超文字检索

❌ 不太推荐的场景

  • 纯文字文档(比如小说、纯文字博客)→ 传统文字搜索更快更便宜
  • 需要毫秒级响应的场景 → 截图 + 视觉理解有一定延迟(但可以优化)

👥 谁最适合用 PixelRAG?

  • 🧑‍🔬 AI 研究者:探索多模态 RAG 的前沿,训练自己的视觉嵌入模型
  • 👨‍💻 开发者:一行 pip install 就能上手,CLI 工具链完整
  • 🤖 AI 代理开发者:接入 Claude 等工具,打造更聪明的浏览器智能体
  • 🏢 企业团队:处理海量 PDF 和网页存档,实现高保真检索
  • 💻 开源爱好者:项目架构清晰(渲染、嵌入、服务三大模块分离),Apache-2.0 开源协议,欢迎贡献

⚠️ 使用前需要知道的事

说了这么多优点,也要诚实地说说局限:

1. 存储空间需求大

因为要存截图和向量索引,占用的磁盘空间比纯文字大很多。维基百科全量索引大约需要 217GB+ 的磁盘空间。

但如果只是处理自己的几十份文档,空间消耗是完全可接受的。

2. 速度比纯文字方式慢一些

毕竟多了"截图"和"视觉理解"两个步骤。不过项目文档里有专门的优化指南。

3. 需要一些硬件支持

  • 小规模使用:普通电脑就行(Mac 的 Apple 芯片也 OK ✅)
  • 大规模建索引:最好有 GPU
  • 训练自定义模型:需要好显卡 + 大磁盘

4. 项目还在活跃开发中

最近的代码更新就在 2026 年 6 月,团队还在持续改进。建议关注 GitHub 获取最新动态。


🎬 总结:一个正在发生的「范式转变」

让我们最后回顾一下:

PixelRAG 代表了 AI 搜索从「读文字」到「看页面」的范式转变。
传统 RAG PixelRAG
方式 解析文字 截图看图
表格 ❌ 常丢失 ✅ 完整保留
图表 ❌ 常丢失 ✅ 完整保留
布局 ❌ 常错乱 ✅ 完整保留
准确率 基准线 📈 最高提升 18.1%

如果你经常处理包含表格、图表、复杂排版的文档,PixelRAG 值得你立即尝试。

最快的体验方式:

👉 打开 https://pixelrag.ai ,输入一个问题,感受「AI 看图搜索」的魔力!

📌 项目地址:https://github.com/StarTrail-org/PixelRAG

📌 在线体验:https://pixelrag.ai

📌 免费 API:https://api.pixelrag.ai

📌 论文:项目仓库 assets/pixelrag-paper.pdf


觉得有用?点个「在看」转发给你的朋友吧! 👇