Os fluxos de trabalho permanecem presos no estado Em execução devido a um deadlock do pod do autor

Este artigo explica como identificar e mitigar um deadlock do pod do autor no Adobe Experience Manager (AEM) as a Cloud Service quando as instâncias de fluxo de trabalho permanecem presas no estado Em execução após a etapa Iniciar.

Descrição description

Ambiente

Adobe Experience Manager (AEM) as a Cloud Service

Problema/Sintomas

  • As instâncias de fluxo de trabalho concluem a etapa Iniciar, mas permanecem no estado Em execução indefinidamente.
  • Os trabalhos de fluxo de trabalho não avançam porque o processamento relacionado ao Sling Event Dispatcher e à observação do Oak em um pod de autor afetado está bloqueado.
  • Em casos observados, nenhum erro de aplicativo correspondente é visível nos registros enquanto o problema está ocorrendo.
  • Reiniciar ou substituir o pod do autor afetado restaura o fluxo de trabalho e o processamento de trabalhos.
  • Exemplos de caminhos de instâncias de fluxo de trabalho podem se parecer com /var/workflow/instances/<server>/<date>/<workflow-instance>.

Causa

Um deadlock que afeta o Sling Event Dispatcher e a observação do Oak em um pod de autor pode impedir a entrega de eventos de fluxo de trabalho e de trabalho, deixando as instâncias de fluxo de trabalho presas no estado Em execução até que o pod afetado seja reiniciado ou substituído.

Resolução resolution

Para corrigir fluxos de trabalho que permanecem presos no estado Em execução devido a um deadlock do pod de autor, tente esta solução alternativa:

  1. Verifique se as instâncias de fluxo de trabalho afetadas permanecem no estado Em Execução após a etapa Iniciar e confirme se os trabalhos relacionados não estão progredindo.
  2. Determine se o comportamento é isolado a um pod de autor específico, comparando a atividade do fluxo de trabalho nas instâncias de autor e revisando os indicadores disponíveis de processamento de evento ou observação paralisado.
  3. Colete despejos de thread do pod do autor afetado durante o incidente, quando possível, para que a condição de deadlock possa ser validada.
  4. Reinicie ou substitua o pod do autor afetado para restaurar o fluxo de trabalho e o processamento do trabalho.
  5. Após a reinicialização, monitore a execução do fluxo de trabalho e a progressão do trabalho para confirmar se os itens recém-iniciados e anteriormente paralisados começam a ser processados novamente.
recommendation-more-help
experience-cloud-kcs-help-kbarticles