# huanghua **Repository Path**: dkb778/huanghua ## Basic Information - **Project Name**: huanghua - **Description**: 机场 - **Primary Language**: Unknown - **License**: Not specified - **Default Branch**: master - **Homepage**: None - **GVP Project**: No ## Statistics - **Stars**: 0 - **Forks**: 0 - **Created**: 2026-07-28 - **Last Updated**: 2026-09-24 ## Categories & Tags **Categories**: Uncategorized **Tags**: None ## README # 企业知识库数据库 本项目提供一套 PostgreSQL 15 + pgvector 的企业知识库表结构,支持: - 企业共享库、部门库和个人知识库 - 全局分类与空间内多级文件夹 - 空间级、可选文件级权限 - 文件解析/向量化任务状态 - `Qwen/Qwen3-Embedding-0.6B` 的 1024 维向量 - 基于余弦距离的 HNSW 近似检索 ## 文件 - `db/001_knowledge_base_schema.sql`:完整、可重复执行的建表脚本 - `db/002_verify_schema.sql`:扩展、表、索引和向量维度检查 - `db/003_smoke_test.sql`:插入、外键、权限和向量测试(数据自动回滚) - `scripts/apply_schema.sh`:建表并自动检查 - `POSTGRESQL.md`:服务器连接、部署和查询说明 ## 一键建表 方式一,使用连接 URL: ```bash export DATABASE_URL='postgresql://pgvector:密码@数据库地址:端口/vector_db' ./scripts/apply_schema.sh ``` 方式二,使用 PostgreSQL 标准环境变量: ```bash export PGHOST='数据库地址' export PGPORT='5432' export PGDATABASE='vector_db' export PGUSER='pgvector' export PGPASSWORD='密码' ./scripts/apply_schema.sh ``` 密码只通过环境变量传入,不要写入仓库。脚本遇到任何 SQL 错误会立即停止;重复执行不会重复创建表或索引。 ## Python 环境 本项目统一使用 Python 3.13 Conda 环境: ```bash conda activate huanghua python --version ``` 在其他机器可以重新创建: ```bash conda env create -f environment.yml conda activate huanghua ``` 项目会自动读取根目录的 `config.json`: ```json { "POSTGRES_HOST": "数据库地址", "POSTGRES_PORT": "数据库端口", "POSTGRES_DB": "vector_db", "POSTGRES_USER": "pgvector", "POSTGRES_PASSWORD": "数据库密码", "EMBEDDING_URL": "Embedding 接口地址", "EMBEDDING_MODEL": "Qwen/Qwen3-Embedding-0.6B" } ``` `POSTGRES_HOST`、`POSTGRES_PORT`、`EMBEDDING_URL` 和 `EMBEDDING_MODEL` 没有填写时会使用当前服务地址。配置文件包含密码,已通过 `.gitignore` 排除,不应提交到 Git。 如有需要,也可以通过环境变量临时覆盖配置: ```bash export PGHOST='数据库地址' export PGPORT='数据库端口' export PGPASSWORD='数据库密码' ``` `project/create_class.py` 提供共享分区、部门知识库、个人文件夹、全局分类和 个人用户知识库的创建功能。`project/process_file.py` 当前负责 DOCX 解析、 中文切分、Embedding 生成以及文档和 Chunk 入库。