Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Meng HealthOmics akses set baca dengan URI Amazon S3
Anda dapat menggunakan jalur URI Amazon S3 untuk mengakses kumpulan baca penyimpanan urutan aktif Anda.
Dengan jalur URI Amazon S3, Anda dapat menggunakan operasi Amazon S3 untuk membuat daftar, berbagi, dan mengunduh kumpulan baca Anda. Akses melalui API S3 mempercepat kolaborasi dan integrasi alat mengingat banyak alat industri yang sudah dibuat untuk dibaca dari S3. Selain itu, Anda dapat berbagi akses ke API S3 dengan akun lain dan menyediakan akses baca lintas wilayah ke data.
HealthOmics tidak mendukung akses URI Amazon S3 ke kumpulan baca yang diarsipkan. Saat Anda mengaktifkan kumpulan baca, set tersebut dikembalikan ke jalur URI yang sama setiap kali.
Dengan data yang dimuat ke HealthOmics toko, karena URI Amazon S3 didasarkan pada titik akses Amazon S3, Anda dapat langsung mengintegrasikan dengan alat standar industri yang membaca URI Amazon S3, seperti berikut ini:
-
Aplikasi analisis visual seperti Integrative Genomics Viewer (IGV) atau UCSC Genome Browser.
-
Alur kerja umum dengan ekstensi Amazon S3 seperti CWL, WDL, dan Nextflow.
-
Alat apa pun yang dapat mengotentikasi dan membaca dari titik akses URI Amazon S3 atau membaca URI Amazon S3 yang telah ditandatangani sebelumnya.
-
Utilitas Amazon S3 seperti Mountpoint atau. CloudFront
Amazon S3 Mountpoint memungkinkan Anda untuk menggunakan bucket Amazon S3 sebagai sistem file lokal. Untuk mempelajari lebih lanjut tentang Mountpoint dan menginstalnya untuk digunakan, lihat Mountpoint untuk Amazon S3.
Amazon CloudFront adalah layanan jaringan pengiriman konten (CDN) yang dibangun untuk kinerja tinggi, keamanan, dan kenyamanan pengembang. Untuk mempelajari lebih lanjut tentang menggunakan Amazon CloudFront, lihat CloudFront dokument asi Amazon. Untuk mengatur CloudFront dengan penyimpanan urutan, hubungi AWS HealthOmics tim.
Akun root pemilik data diaktifkan untuk tindakan S3:GetObject, S3:GetObjectTagging, dan S3:List Bucket pada awalan penyimpanan urutan. Agar pengguna di akun dapat mengakses data, Anda membuat kebijakan IAM dan melampirkannya ke pengguna atau peran. Untuk contoh kebijakan, lihat Izin untuk akses data menggunakan Amazon S3 URIs.
Anda dapat menggunakan operasi Amazon S3 API berikut pada kumpulan baca aktif untuk membuat daftar dan mengambil data Anda. Anda dapat mengakses kumpulan baca yang diarsipkan melalui URI Amazon S3 setelah diaktifkan.
-
GetObject— Mengambil objek dari Amazon S3.
-
HeadObjectOperasi HEAD mengambil metadata dari objek tanpa mengembalikan objek itu sendiri. Operasi ini berguna jika Anda hanya menginginkan metadata objek.
-
ListObjects dan ListObject v2 — Mengembalikan beberapa atau semua (hingga 1.000) objek dalam ember.
-
CopyObject— Membuat salinan objek yang sudah disimpan di Amazon S3. HealthOmicsmendukung penyalinan ke titik akses Amazon S3, tetapi tidak menulis ke titik akses.
HealthOmics penyimpanan urutan mempertahankan identitas semantik file melalui ETag. Sepanjang siklus hidup file, Amazon S3 ETag, yang didasarkan pada identitas bitwise, dapat berubah, namun, HealthOmics ETag tetap sama. Untuk mempelajari selengkapnya, lihat HealthOmics ETag dan asal data.
Topik
Struktur URI Amazon S3 dalam HealthOmics penyimpanan
Semua file dengan URI Amazon S3 memiliki omics:subjectId tag omics:sampleId sumber daya. Anda dapat menggunakan tag ini untuk berbagi akses dengan menggunakan kebijakan IAM melalui pola seperti"s3:ExistingObjectTag/omics:subjectId": "pattern desired".
Struktur file adalah sebagai berikut:
.../account_id/sequenceStore/seq_store_id/readSet/read_set_id/files.
Untuk file yang diimpor ke penyimpanan urutan dari Amazon S3, penyimpanan urutan mencoba mempertahankan nama sumber asli. Ketika nama bertentangan, sistem menambahkan informasi set baca untuk memastikan bahwa nama file unik. Misalnya, untuk set baca fastq, jika kedua nama file sama, untuk membuat nama unik, dimasukkan sebelum .fastq.gz at sourceX au.fq.gz. Untuk upload langsung, nama file mengikuti pola berikut:
-
Untuk FASTQ—
read_set_name_sourcex.fastq.gz -
Untuk uBAM/BAM /CRAM —.
read_set_namefile extensiondengan ekstensi.bamatau.cram. Contohnya adalahNA193948.bam.
Untuk set baca yang BAM atau CRAM, file indeks dibuat secara otomatis selama proses penyerapan. Untuk file indeks yang dihasilkan, ekstensi indeks yang tepat di akhir nama file diterapkan. Ini memiliki pola Ek <name of the Source the index is on>.<file index extension>. stensi indeks adalah .bai atau.crai.
Menggunakan IGV yang Dihosting atau Lokal untuk mengakses set baca
IGV adalah browser genom yang digunakan untuk menganalisis file BAM dan CRAM. Ini membutuhkan file dan indeks karena hanya menampilkan sebagian genom pada satu waktu. IGV dapat diunduh dan digunakan secara lokal, dan ada panduan untuk membuat IGV yang dihosting AWS. Versi web publik tidak didukung karena membutuhkan CORS.
IGV lokal bergantung pada AWS konfigurasi lokal untuk mengakses file. Pastikan peran yang digunakan dalam konfigurasi tersebut memiliki kebijakan terlampir yang memungkinkan GetObject izin KMS:Decrypt dan s3: ke URI s3 dari kumpulan baca yang diakses. Setelah itu, di IGV, Anda dapat menggunakan “File> load from URL” dan paste di URI untuk sumber dan indeks. Atau, URL yang ditandatangani sebelumnya dapat dibuat dan digunakan dengan cara yang sama, yang akan melewati konfigurasi AWS. Perhatikan bahwa CORS tidak didukung dengan akses URI Amazon S3, jadi permintaan yang mengandalkan CORS tidak didukung.
Contoh Hosted AWS IGV bergantung pada AWS Cognito untuk membuat konfigurasi dan izin yang benar di dalam lingkungan. Pastikan kebijakan dibuat yang mengaktifkan GetObject izin EnableSkms:Decrypt dan s3: ke URI Amazon S3 dari kumpulan baca yang diakses, dan tambahkan kebijakan ini ke peran yang ditetapkan ke kumpulan pengguna Cognito. Setelah itu, di IGV, Anda dapat menggunakan “File> load from URL” dan masukkan URI untuk sumber dan indeks. Atau, URL yang ditandatangani sebelumnya dapat dibuat dan digunakan dengan cara yang sama, yang melewati konfigurasi AWS.
Perhatikan bahwa penyimpanan urutan tidak akan muncul di bawah tab “Amazon” karena itu hanya menampilkan bucket yang dimiliki oleh Anda di Wilayah tempat AWS profil dikonfigurasi.
Menggunakan Samtools atau HTSlib di HealthOmics
HTSlib adalah pustaka inti yang dibagikan oleh beberapa alat seperti Samtools, RSAMtools, dan lainnya. PySam Gunakan HTSLIB versi 1.20 atau yang lebih baru untuk mendapatkan dukungan tanpa batas untuk Poin Akses Amazon S3. Untuk versi lama pustaka HTSlib, Anda dapat menggunakan solusi berikut:
-
Setel variabel lingkungan untuk host HTS Amazon S3 dengan:
export HTS_S3_HOST="s3..region.amazonaws.com" -
Buat URL yang telah ditandatangani sebelumnya untuk file yang ingin Anda gunakan. Jika BAM atau CRAM sedang digunakan, pastikan URL yang ditandatangani sebelumnya dihasilkan untuk file dan indeks. Setelah itu, kedua file dapat digunakan dengan pustaka.
-
Gunakan Mountpoint untuk memasang penyimpanan urutan atau membaca awalan set di lingkungan yang sama tempat Anda menggunakan pustaka HTSLIB. Dari sini, file dapat diakses dengan menggunakan jalur file lokal.
Menggunakan Mountpoint HealthOmics
Mountpoint untuk Amazon S3 adalah klien file throughput tinggi yang sederhana untuk memasang bucket Amazon S3 sebagai sistem file lokal.
Mountpoint dapat diinstal dengan menggunakan petunjuk instalasi Moun tpoint.
mount-s3access point arn--prefixlocal path to mount--regionprefix to sequence store or read setregion
Menggunakan CloudFront dengan HealthOmics
Amazon CloudFront adalah layanan jaringan pengiriman konten (CDN) yang dibangun untuk kinerja tinggi, keamanan, dan kenyamanan pengembang. Pelanggan yang ingin menggunakan CloudFront harus bekerja sama dengan tim Layanan untuk mengaktifkan CloudFront distribusi. Bekerja dengan tim akun Anda untuk melibatkan tim HealthOmics layanan.