View a markdown version of this page

Criação de um segmento parecido - AWS Clean Rooms

As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.

Criação de um segmento parecido

nota

Você só pode fornecer um conjunto de dados de treinamento para uso em um modelo semelhante ao Clean Rooms ML que tenha dados armazenados no Amazon S3. No entanto, você pode fornecer os dados iniciais para um modelo semelhante usando SQL que é executado em dados armazenados em qualquer fonte de dados compatível.

Um segmento de semelhanças é um subconjunto dos dados de treinamento que mais se assemelha aos dados de seed.

Para criar um segmento parecido no AWS Clean Rooms
  1. Faça login no Console de gerenciamento da AWS e abra o AWS Clean Rooms console com o seu Conta da AWS (se ainda não tiver feito isso).

  2. No painel de navegação à esquerda, escolha Colaborações.

  3. Na guia Com associação ativa, escolha uma colaboração.

  4. Na guia Modelos de ML, escolha Criar segmento semelhante.

  5. Na página Criar segmento parecido, em Modelo parecido configurado associado, escolha o modelo parecido configurado associado a ser usado nesse segmento semelhante.

  6. Em Detalhes do segmento de semelhanças, insira um nome e uma descrição opcional.

  7. Em Perfis de propagação, selecione o Método de semente selecionando uma opção e, depois, realizando a ação recomendada.

    Opção Ação recomendada
    Caminho do Amazon S3
    1. Selecione um local do Amazon S3.

    2. (Opcional) Selecione Incluir perfis de propagação na saída.

    Consulta SQL Escreva uma consulta SQL e use seus resultados como dados iniciais.
    Modelo de análise Selecione um modelo de análise na lista suspensa e use os resultados criados por um modelo de análise.
  8. Escolha o tipo de trabalhador a ser usado ao criar essa fonte de dados. O tipo de trabalhador padrão é CR.1X. Especifique o número de trabalhadores a serem usados. O padrão é o trabalhador número 16. Para especificar as propriedades do Spark:

    1. Expanda as propriedades do Spark.

    2. Escolha Adicionar propriedades do Spark.

    3. Na caixa de diálogo de propriedades do Spark, escolha um nome de propriedade na lista suspensa e insira um valor.

    As tabelas a seguir fornecem uma definição para cada propriedade.

    Para obter mais informações sobre as propriedades do Spark, consulte Propriedades do Spark na documentação do Apache Spark.

    nota

    Você pode configurar no máximo 50 propriedades do Spark. O valor de cada propriedade pode ter até 500 caracteres.

    Nome da propriedade Description Valor padrão

    Falhas do Spark.Task.Max

    Controla quantas vezes consecutivas uma tarefa pode falhar antes que ela falhe. Requer um valor maior ou igual a 1. O número de novas tentativas permitidas é igual a esse valor menos 1. A contagem de falhas é redefinida se alguma tentativa for bem-sucedida. Falhas em tarefas diferentes não se acumulam em torno desse limite.

    4

    spark.sql.files.max PartitionBytes

    Define o número máximo de bytes a serem compactados em uma única partição ao ler de fontes baseadas em arquivos, como Parquet, JSON e ORC.

    128 MB

    Spark.Hadoop.fs.s3.max tenta novamente

    Define o número máximo de tentativas de novas tentativas para operações de arquivo do Amazon S3.

    (none)

    spark.network.timeout

    Define o tempo limite padrão para todas as interações de rede. Substitui as seguintes configurações de tempo limite se elas não estiverem definidas:

    • spark.storage.block ManagerHeartbeatTimeoutMs

    • Spark.shuffle.io. tempo limite de conexão

    • Spark.rpc.askTimeout

    • spark.rpc. Tempo limite de pesquisa

    120s

    spark.rdd.compress

    Especifica se as partições RDD serializadas devem ser compactadas usando spark.io.compression.codec. Aplica-se a StorageLevel.MEMORY _ONLY_SER em Java e Scala, ou StorageLevel.MEMORY _ONLY em Python. Reduz o espaço de armazenamento, mas exige tempo adicional de processamento da CPU.

    false

    spark.shuffle.spill.compress

    Especifica se os dados de derramamento aleatório devem ser compactados usando spark.io.compression.codec.

    true

    spark.shuffle.compress

    Especifica se os arquivos de saída do mapa devem ser compactados. A compactação usa spark.io.compression.codec.

    true

    spark.shuffle.service.index.cache.size

    Define o limite de tamanho do cache, em bytes, a menos que seja especificado de outra forma.

    100 m

    Spark.shuffle.io.max tenta novamente

    Define o número máximo de novas tentativas para buscas que falham devido a IO-related exceções.

    3

    Spark.shuffle.io.Repetir Aguarde

    Define o tempo de espera entre as novas tentativas de buscas. O atraso máximo causado pela nova tentativa é de 15 segundos por padrão, calculado como maxRetries * RetryWait.

    5s

    Spark.shuffle.io. tempo limite de conexão

    Define o tempo limite para que as conexões estabelecidas entre servidores e clientes aleatórios sejam marcadas como ociosas e fechadas se ainda houver solicitações de busca pendentes, mas não houver tráfego no canal.

    (valor de spark.network.timeout)

    spark.driver.max ResultSize

    Define o limite de tamanho total dos resultados serializados de todas as partições para cada ação do Spark, em bytes. Deve ser pelo menos 1M, ou 0 para ilimitado.

    1g

    faísca.memória.fração

    Define a fração de (espaço de pilha - 300 MB) usada para execução e armazenamento. Quanto menor esse valor, mais frequentemente ocorrem vazamentos e despejos de dados em cache. É recomendável deixar isso no valor padrão.

    0.6

    spark.scheduler.mode

    Define o modo de agendamento entre trabalhos enviados para o mesmo SparkContext. Pode ser definido como FAIR para usar o compartilhamento justo em vez de enfileirar trabalhos um após o outro. Valores suportados: FAIR, FIFO.

    FIFO

    spark.sql.adaptive.advisory PartitionSizeInBytes

    Define o tamanho alvo em bytes para partições aleatórias durante a otimização adaptativa quando spark.sql.adaptive.enabled é verdadeiro. Controla o tamanho da partição ao aglutinar partições pequenas ou dividir partições distorcidas.

    (valor de spark.sql.adaptive.shuffle.targetPostShuffleInputSize)

    spark.sql.adaptive.auto BroadcastJoinThreshold

    Define o tamanho máximo da tabela em bytes para transmissão aos nós de trabalho durante as uniões. Aplica-se somente na estrutura adaptativa. Usa o mesmo valor padrão de BroadcastJoinThreshold spark.sql.auto. Defina como -1 para desativar a transmissão.

    (none)

    spark.sql.adaptive.coalesce Partitions.enabled

    Especifica se as partições aleatórias contíguas devem ser unidas com base em spark.sql.adaptive.advisory para otimizar o tamanho da tarefa. PartitionSizeInBytes Requer que spark.sql.adaptive.enabled seja verdadeiro.

    true

    spark.sql.adaptive.coalesce Partitions.initialPartitionNum

    Define o número inicial de partições aleatórias antes da coalescência. Exige que spark.sql.adaptive.enabled e spark.sql.adaptive.coalesce sejam verdadeiros. Partitions.enabled O padrão é o valor de spark.sql.shuffle.partitions.

    (none)

    spark.sql.adaptive.coalesce Partitions.minPartitionSize

    Define o tamanho mínimo para partições aleatórias coalescidas para evitar que as partições se tornem muito pequenas durante a otimização adaptativa.

    1 MB

    spark.sql.adaptive.coalesce Partitions.parallelismFirst

    Especifica se os tamanhos das partições devem ser calculados com base no paralelismo do cluster em vez de PartitionSizeInBytes spark.sql.adaptive.advisory durante a coalescência da partição. Gera tamanhos de partição menores do que o tamanho de destino configurado para maximizar o paralelismo. Recomendamos definir isso como falso em clusters ocupados para melhorar a utilização de recursos, evitando pequenas tarefas excessivas.

    true

    spark.sql.adaptive.enabled

    Especifica se a execução adaptativa de consultas deve ser ativada para reotimizar os planos de consulta durante a execução da consulta, com base em estatísticas precisas de tempo de execução.

    true

    spark.sql.adaptive.force OptimizeSkewedJoin

    Especifica se a ativação deve ser forçada, OptimizeSkewedJoin mesmo que isso introduza um embaralhamento extra.

    false

    spark.sql.adaptive.local ShuffleReader.enabled

    Especifica se você deve usar leitores aleatórios locais quando o particionamento aleatório não é necessário, como após a conversão de junções sort-merge em junções broadcast-hash. Requer que spark.sql.adaptive.enabled seja verdadeiro.

    true

    spark.sql.adaptive.max ShuffledHashJoinLocalMapThreshold

    Define o tamanho máximo da partição em bytes para criar mapas de hash locais. Prioriza junções de hash embaralhadas em vez de uniões de classificação e mesclagem quando:

    • Esse valor é igual ou superior a spark.sql.adaptive.advisory PartitionSizeInBytes

    • Todos os tamanhos de partição estão dentro desse limite

    Substitui a configuração SortMergeJoin spark.sql.join.prefer.

    0 bytes

    spark.sql.adaptive.optimize SkewsInRebalancePartitions.enabled

    Especifica se é necessário otimizar partições aleatórias distorcidas dividindo-as em partições menores com base em spark.sql.adaptive.advisory. PartitionSizeInBytes Requer que spark.sql.adaptive.enabled seja verdadeiro.

    true

    spark.sql.adaptive.rebalance PartitionsSmallPartitionFactor

    Define o fator limite de tamanho para mesclar partições durante a divisão. Partições menores que esse fator multiplicado por spark.sql.adaptive.advisory são PartitionSizeInBytes mescladas.

    0.2

    spark.sql.adaptive.skew Join.enabled

    Especifica se é necessário lidar com a distorção de dados em uniões embaralhadas dividindo e, opcionalmente, replicando partições distorcidas. Aplica-se a junções de hash sort-merge e shuffled. Requer que spark.sql.adaptive.enabled seja verdadeiro.

    true

    spark.sql.adaptive.skew Join.skewedPartitionFactor

    Determina o fator de tamanho que determina a inclinação da partição. Uma partição é distorcida quando seu tamanho excede ambos:

    • Esse fator multiplicado pelo tamanho médio da partição

    • O valor de spark.sql.adaptive.skew Join.skewedPartitionThresholdInBytes

    5

    spark.sql.adaptive.skew Join.skewedPartitionThresholdInBytes

    Define o limite de tamanho em bytes para identificar partições distorcidas. Uma partição é distorcida quando seu tamanho excede ambos:

    • Esse limiar

    • O tamanho médio da partição multiplicado por spark.sql.adaptive.skew Join.skewedPartitionFactor

    Recomendamos definir esse valor maior que PartitionSizeInBytes spark.sql.adaptive.advisory.

    256 MB

    spark.sql.Tempo limite de transmissão

    Controla o tempo limite em segundos para as operações de transmissão durante as uniões de transmissão.

    300 segundos

    spark.sql.cbo.enabled

    Especifica se a otimização baseada em custos (CBO) deve ser ativada para a estimativa de estatísticas do plano.

    false

    spark.sql.cbo.join Reorder.dp.star.filter

    Especifica se a heurística do filtro star-join deve ser aplicada durante a enumeração de junção baseada em custos.

    false

    spark.sql.cbo.join Reorder.dp.threshold

    Define o número máximo de nós unidos permitidos no algoritmo de programação dinâmica.

    12

    spark.sql.cbo.join Reorder.enabled

    Especifica se é necessário ativar a reordenação de junções na otimização baseada em custos (CBO).

    false

    spark.sql.cbo.plan Stats.enabled

    Especifica se é necessário buscar contagens de linhas e estatísticas de colunas do catálogo durante a geração do plano lógico.

    false

    spark.sql.cbo.star SchemaDetection

    Especifica se a reordenação de junções deve ser ativada com base na detecção do esquema em estrelas.

    false

    spark.sql.files.max PartitionNum

    Define o número máximo alvo de partições de arquivo dividido para fontes baseadas em arquivos (Parquet, JSON e ORC). Redimensiona as partições quando a contagem inicial excede esse valor. Essa é uma meta sugerida, não um limite garantido.

    (none)

    spark.sql.files.max RecordsPerFile

    Define o número máximo de registros a serem gravados em um único arquivo. Nenhum limite se aplica quando definido como zero ou um valor negativo.

    0

    spark.sql.files.min PartitionNum

    Define o número mínimo alvo de partições de arquivo dividido para fontes baseadas em arquivos (Parquet, JSON e ORC). O padrão é spark.sql.leaf. NodeDefaultParallelism Essa é uma meta sugerida, não um limite garantido.

    (none)

    spark.sql.in MemoryColumnarStorage.batchSize

    Controla o tamanho do lote para armazenamento em cache colunar. Aumentar o tamanho melhora a utilização e a compactação da memória, mas aumenta o risco de erros de falta de memória.

    10000

    spark.sql.in MemoryColumnarStorage.compressed

    Especifica se os codecs de compressão devem ser selecionados automaticamente para colunas com base nas estatísticas de dados.

    true

    spark.sql.in MemoryColumnarStorage.enableVectorizedReader

    Especifica se a leitura vetorizada deve ser habilitada para o armazenamento em cache colunar.

    true

    spark.sql.legacy.allow HashOnMapType

    Especifica se devem ser permitidas operações de hash em estruturas de dados do tipo mapa. Essa configuração antiga mantém a compatibilidade com o tratamento de tipos de mapas das versões mais antigas do Spark.

    (none)

    spark.sql.legacy.allow NegativeScaleOfDecimal

    Especifica se devem ser permitidos valores de escala negativos nas definições do tipo decimal. Essa configuração antiga mantém a compatibilidade com as versões mais antigas do Spark que suportavam escalas decimais negativas.

    (none)

    spark.sql.legacy.cast ComplexTypesToString.enabled

    Especifica se o comportamento legado deve ser ativado para converter tipos complexos em cadeias de caracteres. Mantém a compatibilidade com as regras de conversão de tipos das versões mais antigas do Spark.

    (none)

    spark.sql.legacy.char VarcharAsString

    Especifica se os tipos CHAR e VARCHAR devem ser tratados como tipos STRING. Essa configuração antiga oferece compatibilidade com o tratamento de tipos de string das versões mais antigas do Spark.

    (none)

    spark.sql.legacy.create EmptyCollectionUsingStringType

    Especifica se é necessário criar coleções vazias usando elementos do tipo string. Essa configuração antiga mantém a compatibilidade com o comportamento de inicialização da coleção das versões mais antigas do Spark.

    (none)

    spark.sql.legacy.exponent LiteralAsDecimal.enabled

    Especifica se os literais exponenciais devem ser interpretados como tipos decimais. Essa configuração antiga mantém a compatibilidade com o tratamento literal numérico das versões mais antigas do Spark.

    (none)

    spark.sql.legacy.json.allow EmptyString.enabled

    Especifica se as cadeias de caracteres vazias devem ser permitidas no processamento JSON. Essa configuração antiga mantém a compatibilidade com o comportamento de análise JSON das versões mais antigas do Spark.

    (none)

    spark.sql.legacy.parquet.int96 RebaseModeInRead

    Especifica se o modo de rebase de timestamp INT96 legado deve ser usado ao ler arquivos Parquet. Essa configuração antiga mantém a compatibilidade com o tratamento de timestamp das versões mais antigas do Spark.

    (none)

    spark.sql.legacy.time ParserPolicy

    Controla o comportamento de análise de tempo para compatibilidade com versões anteriores. Essa configuração legada determina como os carimbos de data/hora são analisados a partir de cadeias de caracteres.

    (none)

    spark.sql.legacy.type Coercion.datetimeToString.enabled

    Especifica se o comportamento de coerção do tipo legado deve ser ativado ao converter valores de data e hora em cadeias de caracteres. Mantém a compatibilidade com as regras de conversão de data e hora das versões mais antigas do Spark.

    (none)

    spark.sql.max SinglePartitionBytes

    Define o tamanho máximo da partição em bytes. O planejador introduz operações aleatórias para partições maiores para melhorar o paralelismo.

    128m

    spark.sql.metadata em TLSeconds

    Controla o tempo de vida (TTL) dos caches de metadados. Aplica-se aos metadados do arquivo de partição e aos caches do catálogo de sessões. Requer:

    • Um valor positivo maior que zero

    • spark.sql.catalogImplementação definida como hive

    • PartitionFileCacheSize spark.sql.hive.filesource maior que zero

    • FilesourcePartitions spark.sql.hive.manage definido como verdadeiro

    -1000 ms

    spark.sql.optimizer.collapse ProjectAlwaysInline

    Especifica se as projeções adjacentes e as expressões em linha devem ser reduzidas, mesmo quando isso causa duplicação.

    false

    spark.sql.optimizer.dynamic PartitionPruning.enabled

    Especifica se devem ser gerados predicados para colunas de partição usadas como chaves de junção.

    true

    spark.sql.optimizer.enable CsvExpressionOptimization

    Especifica se as expressões CSV devem ser otimizadas no otimizador de SQL removendo colunas desnecessárias das operações from_csv.

    true

    spark.sql.optimizer.enable JsonExpressionOptimization

    Especifica se as expressões JSON devem ser otimizadas no otimizador SQL por meio de:

    • Removendo colunas desnecessárias das operações from_json

    • Simplificando combinações from_json e to_json

    • Otimizando operações named_struct

    true

    spark.sql.optimizer.ExcludedRules

    Define as regras do otimizador a serem desativadas, identificadas por nomes de regras separados por vírgula. Algumas regras não podem ser desativadas, pois são necessárias para serem corretas. O otimizador registra quais regras foram desativadas com êxito.

    (none)

    spark.sql.optimizer.runtime.bloom Filter.applicationSideScanSizeThreshold

    Define o tamanho mínimo de escaneamento agregado em bytes necessário para injetar um filtro Bloom no lado do aplicativo.

    10 GB

    spark.sql.optimizer.runtime.bloom Filter.creationSideThreshold

    Define o limite máximo de tamanho para injetar um filtro Bloom no lado da criação.

    10 MB

    spark.sql.optimizer.runtime.bloom Filter.enabled

    Especifica se é necessário inserir um filtro Bloom para reduzir dados aleatórios quando um lado de uma junção aleatória tem um predicado seletivo.

    true

    spark.sql.optimizer.runtime.bloom Filter.expectedNumItems

    Define o número padrão de itens esperados no filtro Bloom de tempo de execução.

    1000000

    spark.sql.optimizer.runtime.bloom Filter.maxNumBits

    Define o número máximo de bits permitidos no filtro Bloom de tempo de execução.

    67108864

    spark.sql.optimizer.runtime.bloom Filter.maxNumItems

    Define o número máximo de itens esperados permitidos no filtro Bloom de tempo de execução.

    4000000

    spark.sql.optimizer.runtime.bloom Filter.numBits

    Define o número padrão de bits usados no filtro Bloom de tempo de execução.

    8388608

    spark.sql.optimizer.runtime.row LevelOperationGroupFilter.enabled

    Especifica se a filtragem de grupos de tempo de execução deve ser ativada para operações em nível de linha. Permite que as fontes de dados:

    • Remova grupos inteiros de dados (como arquivos ou partições) usando filtros de fonte de dados

    • Execute consultas em tempo de execução para identificar registros correspondentes

    • Descarte grupos desnecessários para evitar regravações caras

    Limitações:

    • Nem todas as expressões podem ser convertidas em filtros de fonte de dados

    • Algumas expressões exigem avaliação do Spark (como subconsultas)

    true

    spark.sql.optimizer.runtime Filter.number.threshold

    Define o número total de filtros de tempo de execução injetados (não DPP). Isso evita OOMs de drivers com muitos filtros Bloom.

    10

    spark.sql.optimizer.runtime Filter.semiJoinReduction.enabled

    Especifica se é necessário inserir uma semiunião para reduzir dados aleatórios quando um lado de uma junção aleatória tem um predicado seletivo.

    false

    spark.sql.parquet.aggregatePushdown

    Especifica se os agregados devem ser enviados para o Parquet para otimização. Suporta:

    • MIN e MAX para tipos booleano, inteiro, flutuante e de data

    • COUNT para todos os tipos de dados

    Lança uma exceção se as estatísticas estiverem ausentes em qualquer rodapé do arquivo Parquet.

    false

    spark.sql.parquet.columnar ReaderBatchSize

    Controla o número de linhas em cada lote de leitores vetorizados do Parquet. Escolha um valor que equilibre a sobrecarga de desempenho e o uso da memória para evitar erros de falta de memória.

    4096

    spark.sql.parquet.enable VectorizedReader

    Especifica se a decodificação vetorizada do Parquet deve ser ativada.

    true

    spark.sql.shuffle.partitions

    Define o número padrão de partições para embaralhamento de dados durante uniões ou agregações. Não pode ser modificado entre reinicializações de consultas de streaming estruturadas no mesmo local do ponto de verificação.

    200

    spark.sql.shuffled HashJoinFactor

    Define o fator de multiplicação usado para determinar a elegibilidade do shuffle hash join. Uma junção hash aleatória é selecionada quando o tamanho dos dados do lado pequeno multiplicado por esse fator é menor do que o tamanho dos dados do lado grande.

    3

    spark.sql.sources.parallel PartitionDiscovery.threshold

    Define o número máximo de caminhos para a listagem de arquivos do lado do driver com fontes baseadas em arquivos (Parquet, JSON e ORC). Quando excedidos durante a descoberta da partição, os arquivos são listados usando uma tarefa distribuída separada do Spark.

    32

    spark.sql.statistics.histogram.enabled

    Especifica se devem ser gerados histogramas de altura equivalente durante o cálculo de estatísticas de coluna para melhorar a precisão da estimativa. Requer uma varredura de tabela adicional além da necessária para estatísticas básicas de colunas.

    false

    spark.dynamic Allocation.executorIdleTimeout

    Define a duração em que um executor deve ficar inativo antes de ser removido quando a alocação dinâmica está habilitada.

    60 segundos

    spark.dynamic Allocation.schedulerBacklogTimeout

    Define a duração em que as tarefas pendentes devem ficar pendentes antes que novos executores sejam solicitados quando a alocação dinâmica está habilitada.

    1s

    spark.dynamic Allocation.sustainedSchedulerBacklogTimeout

    O mesmo que spark.dynamicAllocation.schedulerBacklogTimeout, mas usado somente para solicitações subsequentes do executor.

    (valor de spark.dynamicAllocation.schedulerBacklogTimeout)

    spark.scheduler.min RegisteredResourcesRatio

    Define a proporção mínima de recursos registrados (recursos registrados/total de recursos esperados) a serem esperados antes do início do agendamento. Especificado como um duplo entre 0,0 e 1,0. Independentemente de a proporção mínima de recursos ter sido atingida, o tempo máximo de espera antes do início do agendamento é controlado pelo RegisteredResourcesWaitingTime spark.scheduler.max.

    0.8

    spark.scheduler.max RegisteredResourcesWaitingTime

    Define o tempo máximo de espera para que os recursos sejam registrados antes do início do agendamento.

    Anos 30

    spark.sql.hive.metastore PartitionPruningFallbackOnException

    Especifica se é necessário voltar a obter todas as partições do Hive Metastore e realizar a remoção de partições no lado do cliente Spark ao encontrá-las no metastore. MetaException

    false

    spark.sql.cross Join.enabled

    Especifica se devem ser permitidas consultas que contenham um produto cartesiano sem a sintaxe CROSS JOIN explícita.

    true

    spark.sql.analyzer.maxIterations

    Define o número máximo de iterações que o analisador de consultas executa antes de desistir. Valores mais altos permitem que o analisador processe consultas muito grandes ou profundamente aninhadas.

    100

    spark.sql.dataprefetch.filescan.max ParallelismPerTask

    Define o número máximo de divisões de arquivos a serem pré-buscadas simultaneamente para cada tarefa ao escanear arquivos.

    4

    spark.sql.iceberg.data-prefetch.enabled

    Especifica se a otimização da pré-busca de dados deve ser ativada ao ler tabelas. Iceberg

    true

    spark.sql.legacy.null ValueWrittenAsQuotedEmptyStringCsv

    Especifica se é necessário restaurar o comportamento legado de escrever nulos como sequências vazias entre aspas na saída CSV. Quando falso, o Spark grava nulos como sequências vazias sem aspas.

    false

    spark.max RemoteBlockSizeFetchToMem

    Define o limite de tamanho acima do qual o Spark busca blocos remotos em disco em vez de memória. Isso evita que uma única solicitação grande consuma muita memória.

    200 m

    spark.emr-serverless.allocation.batch.size

    Define o número de executores a serem solicitados de uma vez em cada rodada de alocação de executores.

    20

    Nome da propriedade Description Valor padrão

    spark.sql.auto BroadcastJoinThreshold

    Define o tamanho máximo da tabela em bytes para transmissão aos nós de trabalho durante as uniões. Defina como -1 para desativar a transmissão.

    10 MB (-1 para CR.4X 32 trabalhadores)

    spark.dynamic Allocation.enabled

    Especifica se a alocação dinâmica de recursos deve ser usada, o que aumenta ou diminui o número de executores registrados nesse aplicativo com base na carga de trabalho.

    true

    spark.files.fetch Failure.unRegisterOutputOnHost

    Especifica se é necessário cancelar o registro de todas as saídas de mapa em um host quando ocorre uma falha na busca. Quando falso, o Spark cancela o registro somente das saídas do executor específico que falhou, o que reduz a recálculo desnecessário do estágio.

    false

    spark.io.compression.codec

    Define o codec usado para compactar dados internos, como partições RDD, registro de eventos, variáveis de transmissão e saídas aleatórias. Valores suportados: lz4, snappy, zstd, gzip.

    snappy

    Spark.sql.session.fuso horário

    Define o fuso horário da sessão para lidar com carimbos de data/hora em literais de string e conversão de objetos Java. Aceita:

    • Region-based IDs em area/city formato (como America/Los _Angeles)

    • Deslocamentos de zona no HH:mm:ss formato (+/-) HH, (+/-) HH:mm ou (+/-) (como -08 ou + 01:00)

    • UTC ou Z como aliases para + 00:00

    UTC

  9. Em Acesso ao serviço, escolha o Nome do perfil de serviço existente que será usado para acessar essa tabela.

  10. Se você quiser habilitar Tags para o conjunto de dados de treinamento, escolha Adicionar nova tag e insira o par de Chave e Valor.

  11. Escolha Criar segmento de semelhanças.

Para ver a ação de API correspondente, consulte StartAudienceGenerationJob.