# CLIP **Repository Path**: XuXinX/clip ## Basic Information - **Project Name**: CLIP - **Description**: 对论文《ClipCap: CLIP Prefix for Image Captioning》的复现 - **Primary Language**: Unknown - **License**: Not specified - **Default Branch**: master - **Homepage**: None - **GVP Project**: No ## Statistics - **Stars**: 1 - **Forks**: 0 - **Created**: 2024-07-24 - **Last Updated**: 2024-12-18 ## Categories & Tags **Categories**: Uncategorized **Tags**: None ## README # CLIP #### 介绍 本项目是对论文[[2111.09734\] ClipCap: CLIP Prefix for Image Captioning (arxiv.org)](https://arxiv.org/abs/2111.09734)的复现。主要实现了论文中提出的两种模型并评估了模型的一些指标。 #### 软件架构 ``` ----clip |-coco_train # 存放模型的训练结果 |-data # 存放数据集和预处理的数据 |-coco # COCO数据集和预处理结果 |-Images # 存放用于给模型输出描述的图片 |-results # 存放模型预测的标题和原始标题,用于模型评估 |-COCO_load.py # COCO数据集图片数据加载和CLIP编码 |-config.py # 全局参数设置 |-evaluate.py # 加载验证集数据进行模型评估 |-model.py # 模型定义 |-train.py # 数据集的定义和模型训练 ``` #### 安装教程 1. 克隆项目: ``` git clone https://gitee.com/XuXinX/clip.git cd clip ``` 2. 安装环境: ``` conda env create -f environment.yml conda activate clip_prefix_caption ``` #### 使用说明 1. 下载COCO数据集到文件夹`./data/coco`中 1. 下载 [train_captions](https://drive.google.com/file/d/1D3EzUK1d1lNhD2hAvRiKPThidiVbP2K_/view?usp=sharing) 到 `data/coco/annotations` 2. 下载训练集 [training images](http://images.cocodataset.org/zips/train2014.zip) 测试集 [validation images](http://images.cocodataset.org/zips/val2014.zip) 到文件夹`./data/coco`中并解压 2. (可选)按需求修改`config.py`中的训练参数设置 3. **模型训练(输出模型在`./coco_train`文件夹中):** 1. 运行以下指令进行数据预处理: ``` python COCO_load.py --clip_model_type ViT-B/32 ``` 2. 运行以下指令进行微调语言模型版本的模型训练: ``` python train.py --only_prefix ``` 3. 运行以下指令进行只训练前缀版本的模型训练: ``` python train.py ``` 4. **模型评估:** 1. 运行以下指令进行验证集数据的预处理: ``` python COCO_load.py --clip_model_type ViT-B/32 --datatype val ``` 2. 运行以下指令测试微调语言模型版本的模型: ``` python evaluate.py --model_path your_model_path ``` 3. 运行以下指令测试只训练前缀版本的模型: ``` python evaluate.py --only_prefix --model_path your_model_path ```