# 强逻辑推理大模型 **Repository Path**: zgc-webcompetition/Powerful-Large-Reasoning-Model ## Basic Information - **Project Name**: 强逻辑推理大模型 - **Description**: 项目致力于构建科学问题求解智能体,意在解决数学、物理、化学、生物等不同学科的科学任务,并且利用大模型前沿能力发现并提出好的科学问题。 - **Primary Language**: Unknown - **License**: Apache-2.0 - **Default Branch**: main - **Homepage**: None - **GVP Project**: No ## Statistics - **Stars**: 0 - **Forks**: 0 - **Created**: 2026-01-29 - **Last Updated**: 2026-09-08 ## Categories & Tags **Categories**: Uncategorized **Tags**: None ## README # 强逻辑推理大模型的构建:数据、算法与系统 [English](README.en.md) 面向数学、物理、化学、生物等学科,研究能够理解科研需求、执行科学工作流并从反馈中持续改进的智能体系。以可复验的科学结果检验推理能力,连接高质量数据、模型训练与科研系统。 ## 核心系统 - **Science-Harness**:统一任务、工具与验证接口,记录执行轨迹与阶段产物,分别检验流程合规性与科学正确性,为结果复验和失败归因提供证据。 - **ScienceRSI**:基于执行证据诊断失败,优化工作流、数据策略与 Skill;通过固定预算对照、留出任务和独立验收,保留可复用的改进。 协作流程:Science-Harness 执行任务并输出证据,ScienceRSI 验证改进并返回新工作流,由 Harness 复跑与验证。两大系统处于集成与开源规划阶段。 ## 研究方向 1. **科研智能体**:围绕 PaperAgent / ResearchAgent,研究任务规划、工具调用、代码执行与结果分析,解决长链路执行中的状态约束、失败恢复与结果验证问题。 2. **科学数据工作流**:依托 DataFlow-ScienceHarness,开展科学数据解析、清洗、转换、合成与质量评估,将学科约束转化为可复用的算子、工具与验证规则。 3. **可验证自改进**:利用失败轨迹、领域验证器与专家反馈优化工作流,检验同预算收益与跨任务迁移能力。 4. **强推理模型训练**:针对专业知识、多模态理解、推理与工具调用中的不足构建训练数据,开展监督微调和强化学习,验证对实际任务的作用。 ## 项目进展 截至 2026 年 9 月,项目已开展多模态物理推理数据构建,完成初步监督微调与强化学习实验,搭建统一评测流程,并积累科研执行、形式化验证与过程诊断方法。下一阶段推进 Science-Harness 与 ScienceRSI 集成,验证执行、诊断、改进与复验闭环,逐步扩展数理化生任务包。 本季度录用成果: | 名称 | 会议 | | --- | --- | | MathDebugger | EMNLP 2026 Main | | xVerify | EMNLP 2026 Findings | | GIFT | EMNLP 2026 Findings | | Variational Co-Evolution | COLM 2026 | | EduFlow | ACM MM 2026 | | Canvas-of-Thought | ACM MM 2026 | | SA-Bench | EMNLP 2026 Findings | | ReproAgent | EMNLP 2026 Findings | 其他项目研究:[MorphoBench](https://arxiv.org/abs/2510.14265)、[多模态科学推理与 SeePhys 挑战赛技术报告](https://arxiv.org/abs/2509.06079)。 ## 项目导师 - **董彬**:北京大学博雅特聘教授,任职于北京国际数学研究中心,兼任国际机器学习研究中心副主任、北京中关村学院常务副院长。研究方向为机器学习、科学计算和计算成像。 - **张文涛**:北京大学研究员、博士生导师,OpenDCAI 开源组织负责人。研究方向为以数据为中心的人工智能、LLM 数据系统与 AI4Science。曾任职于腾讯、Apple AIML 和 Mila。 ## 招生方向 ### 方向一:AI 与数据技术 **研究工作**:科研智能体与工作流系统研发;候选生成、多验证器评价与经验复用;科学数据处理、合成及质量评估;监督微调与强化学习实验。 **招募要求**:具备计算机、人工智能或数据科学等相关基础,熟悉 Python、机器学习及独立调试。有 Agent、工作流系统、PyTorch、大模型训练或开源开发经验者优先。 ### 方向二:科学背景与 AI 交叉研究 **研究工作**:科学问题形式化与任务建模;科学数据构建、仿真及领域工具开发;验证器与评测基准建设;科学性错误诊断、逻辑校验及跨任务验证。 **招募要求**:具备数学、物理、化学、生物等学科基础,对 AI for Science、科学推理与科研智能体感兴趣,具备基本 Python 或科学计算能力。有数值仿真、计算化学、生物信息学或科研数据分析经验者优先。 **共同要求**:主动学习、认真负责,持续开展实验与跨学科协作,重视代码质量、实验记录和结果可复现。可按自身优势选择一个方向,参与问题定义、算法设计、系统开发、实验验证、论文写作与开源建设。 ## 联系方式 [wentao.zhang@pku.edu.cn](mailto:wentao.zhang@pku.edu.cn) · [张文涛老师个人主页](https://zwt233.github.io/) 请简要介绍学科背景、研究经历与拟参与方向。 ## 网页使用 直接打开 `index.html`,或在本目录运行 `python -m http.server 8765` 后访问 `http://localhost:8765`。无需安装前端依赖;样式与导航逻辑分别位于 `styles.css` 和 `script.js`。