阿里巴巴开源 Zvec:把向量数据库直接塞进应用,本地 RAG 和 Agent 不必先搭服务器Zvec 是阿里巴巴开源的进程内向量数据库,可直接嵌入应用运行,支持向量检索、全文检索、混合搜索与本地持久化。它面向本地 RAG、Agent、个人知识库和边缘设备,减少独立部署向量数据库服务的复杂度。2026/09/05阅读全文
Google LangExtract:用大模型从非结构化文本中提取可追溯结构化信息的开源工具Google 开源 LangExtract,这是一个基于大语言模型的 Python 信息抽取工具,可以从非结构化文本中提取结构化数据,并保留结果与原文的对应关系,适用于文档分析、知识库构建和 RAG 数据处理场景。2026/08/11阅读全文
PixelRAG:让 AI 直接理解网页截图的开源视觉 RAG 框架PixelRAG 是一个开源视觉 RAG 项目,它突破传统网页文本解析方式,让 AI 通过截图理解网页结构、表格和视觉信息。该项目探索了多模态模型时代知识检索的新方向,为智能搜索和 AI Agent 提供新的技术思路。2026/07/31阅读全文
Crawl4AI:把网页直接转成 LLM 可用 Markdown 的开源爬虫Crawl4AI 是一款面向大语言模型、RAG 与 AI Agent 的开源网页抓取工具,可将复杂网页清洗并转换为模型友好的 Markdown,同时支持动态页面、深度抓取、代理和自定义脚本。2026/07/22阅读全文
微软开源 MarkItDown:把 PDF、Office、图片和网页统一转换为 Markdown微软开源的 MarkItDown 可将 PDF、Word、Excel、PPT、图片、音频、网页及多种文本格式统一转换为 Markdown,适合用于 RAG、知识库、文档索引和 AI 文本分析流程。2026/07/18阅读全文
别再让你的 RAG “盲目搜索”:Agentic RAG 如何重构大模型的认知边界?在企业级大模型应用落地进入深水区的今天,开发者们常面临一个令人沮丧的场景:尽管你精心构建了海量的知识库,但在实际问答中,模型依然会对着库里明明存在的知识“一本正经地胡说八道”。这种现象在架构设计层面被定义为检索失败(Retrieval Failure)。2026/07/11阅读全文