本模块是实习生进入AI/LLM领域的第一步,熟悉专门用于存储RAG问题嵌入的Vector Database概念。


所需掌握的知识


  • Linux基础和Docker:能够通过Docker配置网络和安装应用程序。

  • Python语言:基本语法,pip和虚拟环境(venv)的使用方法。

  • 嵌入概念:初步了解如何将一段文本转换为一系列数学向量,以便计算机比较相似度。


实施步骤


  1. 申请资源:访问https://dev.mdcgroup.vn申请一台中央Linux服务器以部署向量数据库。

  2. 部署ChromaDB:通过Docker Compose安装并运行ChromaDB作为独立服务(Chroma Server),配置默认端口8000。

  3. 连接客户端(Python):在个人电脑上创建Python虚拟环境,安装chromadb库。编写脚本远程连接到Linux上的Chroma Server。

  4. 创建集合并添加数据:创建一个集合,尝试加载文本数据。使用默认的嵌入函数或集成HuggingFace/OpenAI库来创建向量。

  5. 执行相似性查询(向量搜索):编写脚本通过自然语言问题进行搜索。检查返回最接近含义的文本段落的能力(通过嵌入/文本查询)。

  6. 持久化数据管理:配置Docker的存储分区,以确保ChromaDB的向量数据安全地保存到物理硬盘。


结果验收


  • 选择题测试:在内部服务器上完成关于向量数据库概念的简短测试。

  • 问题与建议:提出将ChromaDB应用于MDC Group智能文档搜索工具的建议。

  • 结果报告:提交Python源代码文件,演示流程:加载文档 -> 创建向量 -> 搜索,以及系统稳定运行的日志截图。

  • 周末讨论:分享关于向量数据库与传统关系型数据库的体验。