从文件名、contig标识符和序列长度创建数据帧

1条回答

网友

1楼 · 发布于 2024-04-16 21:55:15

所以我生成了一些虚拟数据：

f1.fasta

>ctg_1_length=147
TCGTGGTCACCGATCGAAGATCCAATATCCGGAGATCGTCTACCTGTATGTAGTAAGCGCAAGGCCCGTTTACTGCGTCACCCTAGCAGAACGCCGACCAGGTCTCCTATAGTCACCGGCCTCGCACCTTTAAGTATGTATAGACGG
>ctg_2_length=141
GCTTGGGTGGGAACGGCTCGTGGCGGAGTACCCGAGAGTGGTTTCGGTATCTGGTGTCGTGCCAGGTTTAATTGAAAATTCAAGATTTTAAGTATCGCTTCAGATAGATTACTTACTGCGAGTGCCTTGTCACAGGGCGGG
>ctg_3_length=124
CCTTCGACCATGGATATCCTAACTCAGCCCCAGCCAGCTAACTCTGGACCAACCGAGAGCGTCTTTCTTTGATGTAACTAAGCTGGCGTTGGGCCCCCCGGTGTTCTAACGTATCTGAAGCCAA
>ctg_4_length=124
CGCGAACTTATCTTGTTATCGAAGATAGCTGTAGGAACTCGGCCAGCCCGACTATTTCGTTCGCCGCTTTCCCCTGGCTCTAGATGCAGTCCACAGATTCTTCTCAGGTGATGCGAGGAACAGG
>ctg_5_length=137
CCAACCCCTGCTCTAGGCTTACCGCCAAGCTACTCAATGGTTCGGTCGATGCAGAACGTATTACTATGTTCTCGACTCTCTGAAACCGCTGTCTACGAGGCAAGCCCCAAAATAGATGGAGGGGCCTCGCCTGTGGG

f2.fasta

>ctg_1_length=106
TCGATATTGGTTAAGGCGCGCAGCAATTTGGGAGTTGACGCACAACGTTCGGATGCGAGAGTGAGCATACGGTAGAGCCGAACCCACAATGGGTAACCGAACGACA
>ctg_2_length=60
CTACGATCTGAAATCCACTTCACGTGATCCGCGAGATGGGTTATTCGGTTTTTAGAACAT
>ctg_3_length=145
ACACTTATATCCACGATTGAGTGGCTCATCGGTGTGACACTCTGACGTCGTTTGAATACCTGCCCGGACAGGGTTTTCGTCAAACTCCCCGCGACGGTTCGTAACTGTCTGTACCCGTCGGCTGGACGAAGTTTAGATATAAAAC
>ctg_4_length=88
GAGCCGCTACATTACTTAATAACTTACAAAGGGCGAAGTCACATATTTCGTAAGAAGCATTCCTCGTCAGAATCCATTCCAAACCCCA
>ctg_5_length=87
CTACGCTAAGCTGCGGTACGACGGGGATATTACACGTACTAATCCATACCAACTAAATGGCATGTTGTTGAAGATAGCACTTTGAGG

下面的代码是一种“纯”python方法，它不需要任何其他模块（除了panda，对于DataFrame）：

import pandas as pd
from pathlib import Path

files = [x for x in Path().iterdir() if x.suffix == ".fasta"]
# [PosixPath('f1.fasta'), PosixPath('f2.fasta')]
read_list = []
for file in files:
    with file.open("r") as handle:
        for line in handle:
            if line.startswith(">"):
                line = line.strip()
                read_list.append((file.name,  # Change to file.resolve() for the absolute path
                                  *line[1:].split("=")
                                ))

df = pd.DataFrame(read_list, columns=["file", "ctg", "len"])

#        file           ctg  len
# 0  f1.fasta  ctg_1_length  147
# 1  f1.fasta  ctg_2_length  141
# 2  f1.fasta  ctg_3_length  124
# 3  f1.fasta  ctg_4_length  124
# 4  f1.fasta  ctg_5_length  137
# 5  f2.fasta  ctg_1_length  106
# 6  f2.fasta  ctg_2_length   60
# 7  f2.fasta  ctg_3_length  145
# 8  f2.fasta  ctg_4_length   88
# 9  f2.fasta  ctg_5_length   87

或者，您可以使用来自^{}的^{}：

import pandas as pd
from pathlib import Path
from Bio import SeqIO 

files = [x for x in Path().iterdir() if x.suffix == ".fasta"]
read_list = []
for file in files:
    with file.open("r") as handle:
        for record in SeqIO.parse(handle, "fasta"):
            read_list.append((file.name, record.id, len(record.seq)))

df = pd.DataFrame(read_list, columns=["file", "ctg", "len"])

#        file               ctg  len
# 0  f1.fasta  ctg_1_length=147  147
# 1  f1.fasta  ctg_2_length=141  141
# 2  f1.fasta  ctg_3_length=124  124
# 3  f1.fasta  ctg_4_length=124  124
# 4  f1.fasta  ctg_5_length=137  137
# 5  f2.fasta  ctg_1_length=106  106
# 6  f2.fasta  ctg_2_length=60    60
# 7  f2.fasta  ctg_3_length=145  145
# 8  f2.fasta  ctg_4_length=88    88
# 9  f2.fasta  ctg_5_length=87    87

它们的工作原理是相同的，即构建一个list（read_list）的tuples。由于每个元组充当一个记录pandas可以很容易地将它们转换为数据帧。你知道吗

相关问题更多 >

编程相关推荐

热门问题

热门文章

从文件名、contig标识符和序列长度创建数据帧

相关问题 更多 >

编程相关推荐

热门问题

热门文章

相关问题更多 >