# ai评审 **Repository Path**: Wangxia2002/ai-review ## Basic Information - **Project Name**: ai评审 - **Description**: Formal reconstruction of the AI-assisted research review experiment. - **Primary Language**: Unknown - **License**: Not specified - **Default Branch**: main - **Homepage**: None - **GVP Project**: No ## Statistics - **Stars**: 0 - **Forks**: 0 - **Created**: 2026-03-23 - **Last Updated**: 2026-03-23 ## Categories & Tags **Categories**: Uncategorized **Tags**: None ## README # ai评审 本项目是一套完整的 AI 时代科研评审实验验证工程,围绕“人机协商评审”这一核心问题,构建了从数据组织、平行对照评审、非共识识别、反事实质询到共识生成与结果分析的全流程实现。项目重点用于对照人类专家组与多类大语言模型在科研项目评审中的评分行为、文本质量和高潜力项目识别能力。 ## 实验目标 项目聚焦三个核心问题: 1. AI 评审主体是否存在系统性高分倾向与评分类同化现象。 2. AI 与人类专家在评审意见质量、批判深度与语义结构上有何差异。 3. 在高争议、高潜力项目上,人机协商机制是否能够优于单一主体判断。 ## 实验设计 本实验采用三层结构组织: - 第一阶段:143 个项目的平行对照评审 - 第二阶段:非共识项目识别、反事实质询与人机共识生成 - 第三阶段:制度调适与试点方案文档化整理 实验主体包括: - 人类专家组 - GPT-4 Turbo - Claude 3 Opus - 文心一言 4.0 - 通义千问 2.5 每个评审主体都会输出总分、分项评分和结构化评审意见,并参与后续的非共识分析与效果比较。 ## 项目结构 ```text ai-review/ ├── configs/ ├── data/ │ ├── source/ │ ├── processed/ │ └── exports/ ├── docs/ ├── figures/ ├── papers/ ├── prompts/ ├── reports/ ├── scripts/ ├── src/ai_review/ └── tests/ ``` ## 环境安装 ```powershell .venv\Scripts\python.exe -m pip install --upgrade pip setuptools wheel .venv\Scripts\python.exe -m pip install -e .[dev] -i http://pypi.tuna.tsinghua.edu.cn/simple --trusted-host pypi.tuna.tsinghua.edu.cn ``` ## 运行方式 ```powershell .venv\Scripts\python.exe scripts\run_pipeline.py --config configs\experiment_validation_targets.json ``` 运行后会自动生成完整实验输出,包括: - `data/processed/projects.csv` - `data/processed/reviews.csv` - `data/processed/non_consensus_projects.csv` - `data/processed/consensus_results.csv` - `data/exports/all_reviews.xlsx` - `data/exports/by_reviewer/` - `data/exports/by_project/` - `reports/experiment_validation_metrics.csv` - `reports/paper_target_metrics.csv` - `reports/experiment_validation_summary.md` - `figures/figure2_score_distribution.png` - `figures/figure3_semantic_networks.png` - `figures/non_consensus_recall.png` ## 分析内容 项目内置了三类核心分析任务: - 评分分布分析:均值、标准差、变异系数、与人类评分的相关性 - 文本质量分析:实质信息熵、通用表达占比、批判疑问密度、语义网络结构 - 非共识识别分析:高争议项目识别、人机协商共识结果、置信区间输出 ## 主要文件 - 实验规格说明:`docs/experiment_spec.md` - AI 评审协议:`docs/model_review_protocol.md` - 实验闭环清单:`docs/closure_checklist.md` - 主运行脚本:`scripts/run_pipeline.py` - 评审导出脚本:`scripts/export_review_packages.py` - 配置文件:`configs/experiment_validation_targets.json` - 数据输入目录:`data/source/` - 数据输出目录:`data/processed/` - 评审导出目录:`data/exports/` - 汇总报告目录:`reports/` - 图表输出目录:`figures/` ## 工程特性 - 采用模块化代码结构,便于扩展评审主体与评价指标 - 支持一键跑通完整实验验证流程 - 提供测试用例保证关键分析逻辑稳定 - 同时保留数据、图表、指标表和摘要报告,方便直接用于论文附录或项目展示