Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.
HealthOmics ETag e provenienza dei dati
Un HealthOmics ETag (tag di entità) è un hash del contenuto inserito in un archivio di sequenze. Ciò semplifica il recupero e l'elaborazione dei dati mantenendo l'integrità del contenuto dei file di dati inseriti. L'ETag riflette le modifiche al contenuto semantico dell'oggetto, non ai suoi metadati. Il tipo di set di lettura e l'algoritmo specificati determinano come viene calcolato l'ETag. Il calcolo dell'ETag non altera il file effettivo o i dati genomici. Quando lo schema del tipo di file del set di lettura lo consente, l'archivio di sequenze aggiorna i campi collegati alla provenienza dei dati.
I file hanno un'identità bit per bit e un'identità semantica. L'identità bit per bit significa che i bit di un file sono identici e un'identità semantica significa che i contenuti di un file sono identici. L'identità semantica è resistente alle modifiche dei metadati e alle modifiche alla compressione poiché acquisisce l'integrità del contenuto del file.
I set di lettura negli archivi in HealthOmics sequenza sono sottoposti a compression/decompression cicli e tracciamento della provenienza dei dati durante tutto il ciclo di vita di un oggetto. Durante questa elaborazione, l'identità bit per bit di un file ingerito può cambiare e dovrebbe cambiare ogni volta che un file viene attivato; tuttavia, l'identità semantica del file viene mantenuta. L'identità semantica viene acquisita come tag di HealthOmics entità, o ETag, calcolato durante l'inserimento dell'archivio di sequenze e disponibile come metadati del set di lettura.
Quando lo schema del tipo di file del set di lettura lo consente, i campi degli aggiornamenti dell'archivio di sequenze sono collegati alla provenienza dei dati. Per i file UBam, BAM e CRAM, viene aggiunto un nuovo @CO tag or all'intestazione. Comment Il commento contiene l'ID dell'archivio della sequenza e il timestamp di ingestione.
eTag Amazon S3
Quando si accede a un file utilizzando l'URI Amazon S3, le operazioni dell'API Amazon S3 possono anche restituire valori ETag e checksum di Amazon S3. I valori ETag e checksum di Amazon S3 sono diversi dagli ETag perché rappresentano l'identità bit per bit del HealthOmics file. Per ulteriori informazioni sui metadati descrittivi e sugli oggetti, consulta la documentazione dell'API Amazon S3 Object. https://docs.aws.amazon.com/AmazonS3/latest/API/API_Object.html I valori ETag di Amazon S3 possono cambiare ad ogni ciclo di attivazione di un set di lettura e puoi utilizzarli per convalidare la lettura di un file. Tuttavia, non memorizzate nella cache i valori ETag di Amazon S3 da utilizzare per la convalida dell'identità del file durante il ciclo di vita del file perché non rimangono coerenti. Al contrario, l' HealthOmics ETag rimane coerente per tutto il ciclo di vita del set di lettura.
Come calcola gli ETag HealthOmics
L'ETag viene generato da un hash del contenuto del file inserito. La famiglia di algoritmi ETag è impostata su MD5Up per impostazione predefinita, ma può essere configurata in modo diverso durante la creazione dell'archivio di sequenze. Quando l'ETag viene calcolato, l'algoritmo e gli hash calcolati vengono aggiunti al set di lettura. Gli algoritmi MD5 supportati per i tipi di file sono i seguenti.
-
FASTQ_MD5UP: calcola l'hash MD5 di una sorgente di set di lettura FASTQ completa e non compressa.
-
BAM_MD5Up — Calcola l'hash MD5 della sezione di allineamento di una sorgente di set di lettura BAM o UBam non compressa come rappresentata nel SAM, in base al riferimento collegato, se disponibile.
-
CRAM_MD5Up — Calcola l'hash MD5 della sezione di allineamento della sorgente del set di lettura CRAM non compressa come rappresentata nel SAM, in base al riferimento collegato.
Nota
L'hashing MD5 è noto per essere vulnerabile alle collisioni. Per questo motivo, due file diversi potrebbero avere lo stesso ETag se fossero stati prodotti per sfruttare la collisione nota.
I seguenti algoritmi sono supportati per la famiglia SHA256. Gli algoritmi vengono calcolati come segue:
-
FASTQ_SHA256up: calcola l' SHA-256 hash di una sorgente completa e non compressa del set di lettura FASTQ.
-
BAM_SHA256up — Calcola l' SHA-256 hash della sezione di allineamento di una sorgente di set di lettura BAM o UBam non compressa come rappresentata nel SAM, in base al riferimento collegato, se disponibile.
-
CRAM_SHA256up — Calcola l' SHA-256 hash della sezione di allineamento di una sorgente del set di lettura CRAM non compressa come rappresentata nel SAM, in base al riferimento collegato.
I seguenti algoritmi sono supportati per la famiglia SHA512. Gli algoritmi vengono calcolati come segue:
-
FASTQ_SHA512up: calcola l' SHA-512 hash di una sorgente completa e non compressa del set di lettura FASTQ.
-
BAM_SHA512up — Calcola l' SHA-512 hash della sezione di allineamento di una sorgente di set di lettura BAM o UBam non compressa come rappresentata nel SAM, in base al riferimento collegato, se disponibile.
-
CRAM_SHA512up — Calcola l' SHA-512 hash della sezione di allineamento di una sorgente del set di lettura CRAM non compressa come rappresentata nel SAM, in base al riferimento collegato.