# 高效工作 **Repository Path**: biocoder/fastwork ## Basic Information - **Project Name**: 高效工作 - **Description**: A series of tools used to make my work effective and super fast - **Primary Language**: Python - **License**: Not specified - **Default Branch**: master - **Homepage**: None - **GVP Project**: No ## Statistics - **Stars**: 0 - **Forks**: 0 - **Created**: 2020-06-11 - **Last Updated**: 2022-06-21 ## Categories & Tags **Categories**: Uncategorized **Tags**: None ## README # 高效工作 ### 介绍 科学研究的思路或许没有什么固定套路,但是工作中的内容却充满了雷同,虽然二代测序生产线一样的分析流程已经解决了主要的分析需求,但是落实到具体的项目中,我们仍然需要一些更加灵活的工具来满足一些常见的需求,例如向Annovar注释文件中添加突变样本的数量及标记,生成用于检查可信度标记的脚本等,因此我开启了这样一个项目,我希望通过该项目,我可以大幅提升二代测序基因组数据的分析速度。 我希望我可以在下午的前两个小时就完成分析,并在之后有空去Luckin Coffee点杯喝的,而不是焦头烂额的追赶Deadline。我认为该方法可行的原因是我在做了很多项目分析之后,发现二代测序的基因组数据分析(这里特指在经过标准分析流程之后的个性化分析内容及售后)总是在围绕着低频有害的snp/indel,候选基因集合,snp/indel/CNV/SV的可信度,变异的可视化,添加新的注释,共有筛选,家系筛选,ACMG这些内容展开的,当然还有一些不常用的,例如基于gene region的burden或者SKAT分析,GWAS,连锁分析等,事实上,这些内容已经涵盖了80%的分析需求,但是我在工作中,常常会花费大量的时间反复写一些类似脚本,或者是将时间浪费在寻找某一个已经有但是不知道存放在哪里的脚本的路上,这些时间显然是可以通过一个整合的工具来节约下来的,然后我就可以用这些时间来学习新的有趣内容或者开发新的感兴趣的研发项目了。 ### 添加标签 `add_tags.py`可以用来添加突变样本的名称及数量,同时也可以用来生成可信度脚本或者bam2html的脚本 **添加突变样本的标签及数量** ``` python add_tags.py -i infile -o ofile -s ``` **生成bam2html的脚本** ``` python add_tags.py -i infile -o ofile -m /path/to/mapping/ -b ``` **生成可信度脚本** ``` python add_tags.py -i infile -o ofile -m /path/to/mapping/ -c ``` 以上的三个功能可以同时实现 ``` python add_tags.py -i infile -o ofile -m /path/to/mapping/ -b -c ``` ### 多重检验校正脚本 ***对指定p值列的值进行基于bonferroni FDR的多重检验校正*** python multiple_test_calibration.py -i infile -o ofile -m "bonferroni,fdr_bh,fdr_by" -p Pvalue ### avinput格式转换为 vcf文件格式 python avinput2vcf.py -i infile -o ofile -fa hg19.fasta