Tập hợp phiên mã De Novo và khám phá gen của thân thịt Cistanche Deserticola-Ⅰ
Sep 18, 2024
Hình nền
Cistanche Deserticola là một loại cây ký sinh hoàn toàn không quang hợp, có giá trị dược liệu lớn và phân bố chủ yếu ở sa mạc Tây Bắc Trung Quốc. Thân thịt khô của nó là một loại thuốc bổ quan trọng trongy học cổ truyền Trung Quốcvới vai trò chủ yếu là cải thiện chức năng tình dục nam giới và tăng cường khả năng miễn dịch, nhưng một số nghiên cứu cơ học đã được thực hiện một phần do thiếu nguồn gen và phiên mã.

THIÊN NHIÊN CISTANCHE TUBULOSA THUỐC TRUYỀN THỐNG TRUNG QUỐC PHGS75% ECH 30% ACT 12%
Kết quả
Trong nghiên cứu này, chúng tôi đã thực hiện giải trình tự phiên mã sâu trong thân thịt của C. Deserticola và khoảng 8{14}} lượt đọc đã được tạo ra bằng cách sử dụng trình tự kết thúc cặp Illumina trên nền tảng HiSeq2000. Bằng cách sử dụng trình biên dịch bộ ba, chúng tôi đã thu được 95.787 trình tự phiên mã với độ dài bản phiên mã từ 200bp đến 15.698bp, có độ dài trung bình là 950 cơ sở và độ dài N50 là 1.519 cơ sở. 63.957 bản phiên mã được xác định là được biểu thị tích cực với FPKM Lớn hơn hoặc bằng 0,5, trong đó 30.098 bản phiên mã được chú thích bằng mô tả gen hoặc thuật ngữ bản thể gen bằng cách phân tích độ tương tự trình tự đối với một số cơ sở dữ liệu công cộng (Uniprot, NR và Nt tại NCBI và KEGG) . Hơn nữa, chúng tôi đã xác định được các gen enzyme quan trọng liên quan đến quá trình sinh tổng hợp lignin và phenylethanoid glycoside (PhGs) được biết đến là thành phần hoạt chất chính. Bốn gen phenylalanine amoniac-lyase (PAL), enzyme chủ chốt đầu tiên trong quá trình sinh tổng hợp lignin và PhG đã được xác định dựa trên so sánh trình tự và phân tích phát sinh gen. Hai con đường sinh tổng hợp PhG cũng lần đầu tiên được đề xuất.
Kết luận
Nói chung, chúng tôi đã hoàn thành một phân tích toàn cầu về bản phiên mã của thân thịt C. Deserticola bằng công nghệ RNA-seq. Một tập hợp các gen enzyme liên quan đến quá trình sinh tổng hợp lignin và phenylethanoid glycoside đã được xác định từ các bản phiên mã được lắp ráp và chú thích, đồng thời họ gen của PAL cũng được dự đoán. Dữ liệu trình tự từ nghiên cứu này sẽ cung cấp một nguồn tài nguyên quý giá để tiến hành nghiên cứu sinh tổng hợp phenylethanoid glycoside trong tương lai và nghiên cứu bộ gen chức năng ở cây thuốc quan trọng này.
Giới thiệu
C. Deserticola là một chi thực vật sa mạc lâu năm thuộc họ Orobanchaceae trên toàn thế giới và là một loài hoàn toàn không quang hợp và thường mọc thực vật ký sinh toàn thân dưới lòng đất. Nó ký sinh trên rễ của cây psammophyte Haloxylon ammodendron (Chenopodiaceae), loài cây chủ yếu sinh sống ở sa mạc và bán sa mạc do có khả năng chịu hạn và mặn cao. C. Deserticola cho thấy khả năng chống chọi mạnh mẽ với các điều kiện môi trường khắc nghiệt và phân bố chủ yếu ở Tây Bắc Trung Quốc, đặc biệt là ở Nội Mông, Cam Túc và Tân Cương. Nó được coi là một loài hoang dã có nguy cơ tuyệt chủng trong những năm gần đây do con người tiêu thụ ngày càng tăng. C. Deserticola thường được gọi là nhân sâm sa mạc, thường được gọi là cây chổi sa mạc và thân thịt khô đã được sử dụng rộng rãi như một loại thuốc bổ truyền thống quan trọng ở Trung Quốc và Nhật Bản trong nhiều năm. Nó lần đầu tiên được ghi lại trong Shen Nong Ben Cao Jing (Từ điển Dược liệu Trung Quốc, 1977) khoảng 1800 năm trước và được coi là một trong những nguồn chính củaDược thảo Trung Quốc Cistanche.

CISTANCHE TUBULOSA TỰ NHIÊN ĐỂ CẢI THIỆN CHỨC NĂNG TÌNH DỤC PHGS75% ECH 30% ACT 12%
Chất chiết xuất từ C. Deserticola có nhiều chức năng chữa bệnh, đặc biệt được sử dụng trong việc cải thiện chức năng tình dục, bồi bổ thận, bảo vệ gan, hoạt động khai vị, tăng cường trí nhớ, điều hòa miễn dịch, hoạt động chống oxy hóa, chống viêm, hoạt động kháng vi-rút, v.v. thành phần hoạt tính sinh học chính của C. Deserticola là glycoside Phenylethanoid (PheGs, PhGs). Cho đến nay, hơn 20 glycosid phenylethanoid đã được phân lập từ thân mọng nước của C.deserticola. Trong số đó,Acteoside và Echinacosidelà hai thành phần chính có hoạt tính dược lý quan trọng và được ghi nhận là tiêu chuẩn chất lượng của C. Deserticola trong dược điển Trung Quốc (phiên bản 2005 và 2010). Ba thành phần hóa học của PhG là axit hữu cơ, saccharide và phenylethanoid, tuy nhiên, các chi tiết liên quan đến con đường sinh tổng hợp phenylethanoid vẫn chưa được hiểu rõ ở C.deserticola.
Bất chấp tầm quan trọng về mặt thương mại và y học của C.deserticola, dữ liệu về bộ gen và phiên mã của loài này rất hạn chế. Không có EST nào có sẵn trong cơ sở dữ liệu NCBI và thông tin bộ gen hoàn chỉnh cho loài này vẫn chưa có sẵn ngoại trừ trình tự bộ gen lục lạp. Dữ liệu phiên mã hạn chế cản trở việc nghiên cứu các cơ chế sinh tổng hợp PhG. Công nghệ RNA-seq có thể tạo ra trình tự các phần biểu hiện của bộ gen mục tiêu và xác định gen [18] bằng cách sử dụng nền tảng công nghệ NGS (chẳng hạn như Hệ thống sinh học ứng dụng SOLiD, Illumina HiSeq và Roche 454). Nó ngày càng trở nên phổ biến trong lắp ráp Transcriptome de novo, vì đây là một cách tiếp cận hiệu quả và hiệu quả về mặt chi phí với độ phân giải cao và dải động rộng, đặc biệt vì nó có lợi thế là khám phá các bản ghi có độ phong phú thấp. Do có nhiều ưu điểm khác nhau, RNA-seq đặc biệt hấp dẫn đối với các sinh vật không phải mô hình có nguồn gen hạn chế. Tuy nhiên, chưa có nghiên cứu chi tiết về bản phiên mã C. Deserticola bằng RNA-seq.
Trong nghiên cứu này, chúng tôi đã giải trình tự toàn bộ bản phiên mã gốc của C. Deserticola bằng cách sử dụng nền tảng Illumina Hiseq2000 và thu được dữ liệu thô 7,9G. Bằng cách lắp ráp và chú thích, chúng tôi đã khai thác được các gen liên quan đến quá trình sinh tổng hợp PhG và các gen chịu trách nhiệm cho toàn bộ quá trình sinh tổng hợp lignin. Phân tích RNA-seq của chúng tôi đã tạo ra bản phiên mã đồng thuận C. Deserticola đầu tiên và cung cấp những hiểu biết mới về sự hiểu biết toàn diện về giá trị y học của C. Deserticola. Ngoài ra, phương pháp được mô tả ở đây có thể được áp dụng rộng rãi cho các bản phiên mã hồ sơ để tạo điều kiện thuận lợi cho việc phát hiện các gen liên quan đến con đường sinh tổng hợp thành phần dược liệu cụ thể ở một cây thuốc khác có nguồn gen rất hạn chế.
Vật liệu và phương pháp
Bộ sưu tập nguyên liệu thực vật
Thân cây mọng nước tươi của C. Deserticola trong giai đoạn khai quật được thu thập từ một cơ sở thực vật ở Thành phố BayanHot của Alxa League ở Nội Mông ở tây bắc Trung Quốc. Giấy phép thu gom được cấp từ chủ sở hữu (Tập đoàn HongKui CongRong) của cơ sở nhà máy. Mẫu chứng từ đã được gửi vào Cơ sở gen cốt lõi tại Viện gen Bắc Kinh, Viện Hàn lâm khoa học Trung Quốc. Sau khi làm sạch, các mô thân mọng nước được cắt thành từng miếng nhỏ và đông lạnh ngay lập tức trong nitơ lỏng, sau đó được bảo quản ở nhiệt độ -80 cho đến khi xử lý tiếp.
Trích xuất RNA, xây dựng thư viện cDNA và giải trình tự Illumina
Tổng RNA được chiết xuất từ thân mọng nước bằng TRIzol Reagent (Invitrogen Inc., California, USA) theo hướng dẫn của nhà sản xuất. Các mẫu thu được được xử lý bằng DNase I để loại bỏ bất kỳ DNA bộ gen nào. RNA chiết xuất được định lượng bằng máy phân tích sinh học Agilent 21{10}}0 (Công nghệ Agilent) và kiểm tra tính toàn vẹn bằng phương pháp điện di trên gel agarose biến tính bằng phương pháp nhuộm ethidium bromide. Các mẫu RNA có tỷ lệ A260/A280 trong khoảng từ 1,9 đến 2,1, tỷ lệ RNA 28S:18S cao hơn 1,0 và số nguyên vẹn RNA (RIN) -8.5 đã được sử dụng trong các phân tích tiếp theo.
Các thư viện RNA-seq được tạo bằng Bộ chuẩn bị mẫu Illumina Truseq RNA. Poly(A)+ RNA được phân lập từ RNA tổng số bằng cách sử dụng hạt Dynal ligo(dT)25 theo hướng dẫn của nhà sản xuất. Sau khi tinh chế, bộ đệm phân mảnh được thêm vào để phá vỡ mRNA thành các đoạn ngắn. CDNA chuỗi đầu tiên được tổng hợp bằng cách sử dụng các đoạn ngắn này làm mẫu, cùng với enzyme phiên mã ngược SuperScript III và mồi hexamer ngẫu nhiên N6. Sau đó, cDNA chuỗi thứ hai được tổng hợp bằng cách sử dụng bộ đệm, dNTP, RNaseH và DNA polymerase I. CDNA chuỗi kép thu được được sửa chữa cuối cùng bằng cách sử dụng T4 DNA polymerase, đoạn DNA polymerase I Klenow và T4 polynucleotide kinase, rồi gắn vào bộ chuyển đổi sử dụng T4 DNA ligase. Các mảnh được nối với bộ chuyển đổi được tinh chế bằng bộ chiết QiaQuick PCR và rửa giải bằng đệm EB. Sau khi phân tích bằng phương pháp điện di trên gel agarose, các đoạn phù hợp đã được chọn làm mẫu để khuếch đại PCR. Việc giải trình tự thư viện cDNA thu được được thực hiện bằng hệ thống Illumina HiSeq 2000.
Bảng điểm de novo lắp ráp và định lượng biểu hiện gen
Các lần đọc thô được tạo từ trình tự đã được làm sạch bằng cách loại bỏ các trình tự bộ điều hợp (ATCTCGTATGCCGTC) bằng phương pháp nội bộ. Sau đó, chúng tôi đã thực hiện quy trình lọc chất lượng thấp nghiêm ngặt. Đầu tiên, các cơ sở có điểm chất lượng phred thấp hơn 20 sẽ bị cắt bớt từ đầu thứ 3 của chuỗi, cho đến khi gặp một cơ sở có chất lượng cao hơn (Lớn hơn hoặc bằng 20). Nếu độ dài đọc ngắn hơn 50bp, nó sẽ bị loại bỏ. Thứ hai, các lần đọc sẽ được lọc thêm theo tiêu chí 70% số cơ sở trong một lần đọc có điểm chất lượng cao (Lớn hơn hoặc bằng 20). Thứ ba, chỉ các lần đọc kết thúc được sử dụng để lắp ráp thêm. Việc lắp ráp bản ghi De novo được thực hiện bằng cách sử dụng bản phát hành Trinity_20130216 [30] bao gồm ba mô-đun phần mềm kế tiếp: Inchworm, Chrysalis và Butterfly. Các tham số lắp ráp được đặt như sau:-seqType fq-JM 300G -min_contig_length 200-CPU 20-inchworm_cpu {{21} }bflyCPU 20.
Để định lượng mức độ phong phú của bản ghi, các lần đọc cuối cặp theo trình tự đã được căn chỉnh lại với các bản ghi đã được tập hợp bằng cách sử dụng tập lệnh trong Trinity. Các lần đọc ánh xạ được sử dụng để định lượng bằng phần mềm RSEM (RNA-Seq by Expectation Maximization). Sự phong phú về gen hoặc isoform được biểu thị bằng giá trị đoạn trên mỗi kilobase của bản phiên mã trên một triệu đoạn được ánh xạ (FPKM), những bản phiên mã có giá trị FPKM bằng hoặc lớn hơn 0.05 được xác định như được biểu thị.
Chú thích chức năng của bảng điểm được thể hiện
Không có bộ chú thích gen nào của C. Deserticola ngoại trừ bộ gen lục lạp [1]. Chúng tôi chú thích các bản ghi được thể hiện bằng cách so sánh chúng với các tập dữ liệu được cập nhật riêng biệt trên Genbank Nt, Genbank Nr và TAIR10_ pep_20101214_ bằng chương trình BLAST (E< = 1e-20). Meanwhile, all expressed transcripts were translated into potential proteins according to ORF prediction by TransDecoder and predicated for the conserved domains based on the Pfam database.
Chú thích gen Gene Onology và KEGG Bằng cách căn chỉnh trình tự tương tự với cơ sở dữ liệu Uniprot (chú thích Gene Onology (GO) của tất cả các bản sao được lắp ráp đã thu được bằng cách sử dụng tệp liên kết được tải xuống từ (ftp://ftp.ebi.ac.uk/pub/ cơ sở dữ liệu/GO/goa/UNIPROT/gene_assocation. goa_uniprot.gz). Việc phân nhóm thuật ngữ GO được thực hiện bằng cách sử dụng các tập lệnh tùy chỉnh và chúng tôi đã chú thích các gen ở cấp độ thứ tư cho Các loại CC, BP và MF riêng biệt.
Thông tin về đường dẫn KEGG đã được chỉ định cho tất cả các chuỗi protein được dự đoán bằng công cụ trực tuyến KAAS (Máy chủ chú thích tự động KEGG) [34]. Các chuỗi ở định dạng fasta đã được gửi theo yêu cầu của KAAS và các tệp kết quả của tất cả thông tin về đường dẫn liên quan đến bản phiên mã gốc C. Deserticola đã được tải xuống. 13 bộ dữ liệu gen của sinh vật thực vật trong KEGG đã được sử dụng để chú thích bằng phương pháp BBH (cú đánh tốt nhất hai chiều).

CHIẾT XUẤT CISTANCHE TUBULOSA CISTANCHE TỰ NHIÊN PHGS75% ECH 30% ACT 12%
Phân tích RT-qPCR
Sau khi tiêu hóa bằng DNase I, khoảng 5ug tổng số RNA đã được chuyển đổi thành cDNA chuỗi đầu tiên thông qua phản ứng sao chép ngược với các đoạn mồi oligo(dT)15 và Hệ thống sao chép ngược GoScript (Promega). Sau đó, các sản phẩm cDNA được pha loãng gấp 10-với nước khử ion không có nuclease trước khi sử dụng làm mẫu trong PCR thời gian thực. Các cDNA cụ thể đã được khuếch đại bởi hệ thống GoTaq 2-Step RT-qPCR (Promega) với thể tích 20 ul. Quá trình khuếch đại PCR được thực hiện ở nhiệt độ ủ 60 độ với Hệ thống phát hiện PCR thời gian thực 7500 (Hệ thống sinh học ứng dụng) theo hướng dẫn của nhà sản xuất. Mức độ phong phú của bản phiên mã tương đối được tính toán bằng phương pháp ngưỡng chu kỳ so sánh với gen "comp{13}}c0" làm tiêu chuẩn nội bộ, sử dụng phần mềm 7500 Manager.
Các cặp mồi cho RT-PCR được thiết kế dựa trên phần mềm trực tuyến (//primer3.ut.ee/) và được liệt kê trong Bộ dữ liệu S1.
Kết quả
Giải trình tự RNA và lắp ráp phiên mã de novo của thân thịt C. Deserticola
Thân của C. Deserticola đã được sử dụng rộng rãi như một loại thuốc bổ truyền thống quan trọng ở Trung Quốc và Nhật Bản trong nhiều năm. Để có được cái nhìn tổng quan toàn cầu về biểu hiện gen ở thân thịt C. Deserticola, chúng tôi đã thu thập các mẫu thân C. Deserticola của cùng một cơ sở thực vật vào năm 2013 và 2014. Tổng số RNA được chiết xuất và polyA+ RNA được tinh chế để xây dựng các thư viện RNA-seq đầu cặp. 79.433.734 và 86,019.176 lượt đọc cuối cặp tương ứng với gần 8 tỷ và 8,6 tỷ cơ sở của trình tự đã thu được bằng cách sử dụng trình tự Illumina HiSeq 2000

nền tảng trong mẫu 2013-năm và 2014-năm (Bảng 1). Sau khi xóa trình tự bộ điều hợp và lọc các lần đọc chất lượng thấp (xem chi tiết trong Phương thức), 64.831.040 lần đọc cuối cặp chất lượng cao trong mẫu 2013-năm đã được sử dụng để tập hợp bản chép lại de novo. Bằng cách sử dụng trình biên dịch trình tự Trinity [30], 51.719 gen và 95.787 trình tự phiên mã đã được tạo ra với độ dài bản phiên mã dao động từ 200 bp đến 15.698 bp. Độ dài trung bình của bảng điểm được tập hợp là 950 cơ sở và chiều dài N50 là 1.519 cơ sở. Số lượng bản phiên mã có độ dài khác nhau cho thấy 57,32% bản phiên mã được tập hợp có kích thước khoảng 500 bp hoặc dài hơn (Hình 1A). Các lần đọc cuối cặp chất lượng cao trong mẫu năm 2014-được ánh xạ tới bản ghi đã được tập hợp. Ngoài ra, chúng tôi nhận thấy rằng số lượng bản phiên mã của mỗi gen được lắp ráp khác nhau và 69% gen có một dạng đồng phân biểu hiện trong khi 31% gen biểu hiện hai bản phiên mã trở lên (Hình 1B).
Định lượng biểu thức và chú thích chức năng của bảng điểm được lắp ráp
Sự phong phú về gen hoặc bản phiên mã đã được định lượng bằng cách sử dụng gói RSEM, trong đó các lần đọc theo trình tự được căn chỉnh lại với các gen hoặc trình tự phiên mã được lắp ráp bằng Bowtie và các lần đọc ánh xạ đó được sử dụng để định lượng. Giá trị FPKM cho mỗi gen hoặc bản phiên mã đã được tính toán và cuối cùng, chúng tôi đã xác định được 63.957 và 52.857 bản phiên mã được biểu thị tích cực (giá trị FPKM Lớn hơn hoặc bằng 0.5) trong các mẫu thân thịt C. Deserticola ở 2{{17} }13 và 2014 tương ứng. 44.776 bản ghi (70,01% trong mẫu 2013-năm, 84,71% trong mẫu 2014-năm) thường được biểu thị trong hai lần lặp lại và mối tương quan (hệ số tương quan Pearson: 0,91979) của dữ liệu biểu thức của chúng là được hiển thị trong Hình S1. Dữ liệu thô tuần tự đã được tải lên cơ sở dữ liệu NCBI SRA (số gia nhập: SRX857402 và SRX858938). Chúng tôi đã sử dụng các gen biểu hiện được xác định trong mẫu năm 2013-để phân tích thêm. Thông tin chú thích chức năng cho tất cả các bản ghi được thể hiện được lấy bằng hai phương pháp. Đầu tiên, tất cả các bản phiên mã được biểu thị đều được căn chỉnh theo cơ sở dữ liệu trình tự nucleotide (GenBank nt) và peptide đã biết (GenBank nr và Arabidopsis peptide) một cách riêng biệt bằng thuật toán BLAST. Trong số 63.957 bảng điểm được thể hiện,

29.220 (45,7%) đã được chú thích và thể hiện sự tương đồng với các trình tự trong bất kỳ cơ sở dữ liệu chủ đề nào trong ba cơ sở dữ liệu chủ đề có ngưỡng giới hạn giá trị E 1e-20. Trong khi đó, các vùng mã hóa ứng cử viên cho tất cả các chuỗi bản phiên mã được biểu thị đã được dự đoán bằng phần mềm TransDecoding và ORF dài nhất cho mỗi bản phiên mã được sử dụng để tìm kiếm miền Pfam. Kết quả là 21.358 (33,4%) bản ghi được chú thích dựa trên cơ sở dữ liệu Pfam. Nhìn chung, 30.098 (47,1%) bản phiên mã được so khớp đáng kể với các gen đã biết trong cơ sở dữ liệu công cộng bằng cách kết hợp hai phương pháp trên. Danh sách bản ghi được thể hiện đầy đủ với chú thích chức năng đã được hiển thị trong dữ liệu bổ sung (Bộ dữ liệu S2).
Chúng tôi đã khảo sát 20 bản phiên mã được thể hiện cao nhất (Bảng 2) tương ứng với 18,99% tổng số lần đọc trình tự và nhận thấy rằng hầu hết chúng là các gen phản ứng với môi trường phi sinh học.

kích thích căng thẳng. Dehydrin (DHN), một loại protein gây căng thẳng ưa nước và chịu nhiệt với số lượng axit amin tích điện cao thuộc họ Dồi dào phôi muộn (LEA) Nhóm II, là gen được biểu hiện cao nhất. Ba bản phiên mã Dehyrin khác nhau (comp28713_c0_seq1/2/4) được phát hiện là có biểu hiện cao ở thân thịt có thể liên quan đến việc bảo vệ tế bào khỏi bị hư hại do hạn hán gây ra. Các gen liên quan đến căng thẳng khác như protein sốc nhiệt, protein liên quan đến mầm bệnh và metallicothionein cũng được phát hiện có biểu hiện cao, điều này có thể liên quan đến môi trường sống sót khắc nghiệt của nó. Ngoài ra, một số gen cấu thành bao gồm gen RNA ribosome 26S (comp22329_c2_seq1), protein liên kết với auxin/ngủ (comp20999_c0_seq1), Yếu tố ribosyl hóa ADP (comp20499_ c0_seq1) cũng được phiên mã cao.

CISTANCHE TUBULOSA TỰ NHIÊN ĐỂ CẢI THIỆN MIỄN DỊCH PHGS75% ECH 30% ACT 12%







