Lire un fichier FASTA
Le format FASTA est la lingua franca de la bioinformatique. NCBI, EMBL, Ensembl, vos collaborateurs — tous échangent des séquences dans ce format ultra-simple :
- une ligne d’en-tête commençant par
>(ID + description) - une ou plusieurs lignes contenant la séquence (souvent 60 ou 80 caractères/ligne)
Pour notre projet, on travaille avec un échantillon pédagogique. Sauvegardez-le dans un fichier echantillon.fasta :
>gene_pedagogique | exemple synthetique 270 bp
GCAGCAATGGTTGTAGCTGTACATAATGCTATGCAGAAAATCTTAGAGTG
TCCCATCTGTCTGGAGTTGATCAAGGAACCTGTCTCCACAAAGTGTGACC
ACATATTTTGCAAATTTGTAACATGCTGAAACTTCTCAACCAGAAGAAAG
GGCCTTCACAGTGTCCTTTATGTAAGAATGATATAACCAAAAGGAGCCTA
CAAGAAAGTACGAGATTTAGTCAACTTGTTGAAGAGCTATTGAAAATCAT
TTGTGCTTTTCAGCTTGACACAGGTTTGGAGÉcrivez une fonction lire_fasta(chemin) qui retourne un tuple (entete, sequence), où :
enteteest la première ligne sans le caractère>sequenceest la concaténation de toutes les lignes suivantes, en majuscules, sans espaces ni sauts de ligne
Affichez l’en-tête et la longueur de la séquence.
En-tête : gene_pedagogique | exemple synthetique 270 bp
Longueur : 270 bases