#----------- # PASA daphj: all dpulex ESTs, dmagna ESTs (13k) + dpulex JGI V11 gene set # 08nov01 gzcat daphnia-EST-jgi.fa.gz daphnia-EST-HCGS-200608.fa.gz \ daphnia_ESTnomagna.fa.gz dmagna_est0811.fa.gz \ > daphnia_EST_0811.fa #............................ set rname=pasa_daphj set dest1=daphnia_EST_0811.fa set dgenome=dpulex_jgi060905.repeatmasked.fa set dgenes=dpulex_jgi060905_JGI_V11.gff #............................ touch log.$rname echo "# Transcript alignments followed by alignment assembly" \ >> log.$rname ../scripts/Launch_PASA_pipeline.pl -c alignAssembly.config \ -C -R --USE_GMAP \ -g $dgenome -t $dest1 \ >> & log.$rname ## optional echo "# Importing the latest annotations into the PASA database" \ >> log.$rname ../scripts/Load_Current_Gene_Annotations.dbi -c alignAssembly.config \ -g $dgenome -P $dgenes \ >> & log.$rname ## optional echo "# Performing an annotation comparison" \ >> log.$rname ../scripts/Launch_PASA_pipeline.pl -c annotCompare.config \ -A -g $dgenome -t $dest1 \ >> & log.$rname perl -pi -e's/ID=chain/Parent=chain/;' $rname.pasa_assemblies.gff3 echo "# Updating our gene structure annotations" \ >> log.$rname ../scripts/cDNA_annotation_updater.dbi \ -M "${rname}:localhost-port=3306-mysql_socket=/tmp/fbmysql.sock:myuser:xxxxxx" -P null \ >> & log.$rname #.... output training genes $pa/scripts/pasa_asmbls_to_training_set.dbi \ -g $dgenome \ -M "${rname}:localhost-port=3306-mysql_socket=/tmp/fbmysql.sock" \ -p "myuser:xxxxxx" \ > log.train.$rname #..... echo "## Identification and Classification of All Alternative Splicing Variations" \ >> log.$rname ../scripts/Launch_PASA_pipeline.pl -c alignAssembly.config \ -g $dgenome -t $dest1 --ALT_SPLICE \ >> & log.$rname #... if wanted; same as -A gff ... echo "# dump current annots to gff" \ >> log.$rname ## this regurgitates the -A compare .gff output ../scripts/dump_valid_annot_updates.dbi \ -M "${rname}:localhost-port=3306-mysql_socket=/tmp/fbmysql.sock" \ -p "myuser:xxxxxx" \ >> & log.$rname #-------- training set for augustus : genbank fmt ----- gzcat pasa_out/trainingSetCandidates.gff.gz | perl -pe 's/ID=TU.asm/ID=Model.asm/; s/alignAssembly-// ; s/Name=Training gene;//;' > dmel_pasatrain_genes.gff $bg/blast/cdsgff2genbank.pl -t='CDS,exon,gene' -a=genbank -pasa \ ? -gff=dmel_pasatrain_genes.gff -fasta=$dgenome > dmel_pasatrain_genes.gb # filter out dupl. genes, complete only