The provisioning-service-app pods in Aria Automation are periodically restarted by Kubernetes with an OOMKilled exit code 137. One or more of the following symptoms may be present:
Aria Automation 8.18.x
This issue is caused by a memory leak in the Netty library used within the provisioning service.
Fixed in VMware Aria Automation release 8.18.1 P4 and higher.
Workaround:
vracli cluster exec -- bash -c 'rm -rf /etc/vmware-prelude/profiles/netty-no-direct-memory'
Create the custom profile by executing the following command on one vRA node:
vracli cluster exec -- bash -c 'current_node; base64 -d <<< IyEvYmluL2Jhc2gKIyBDb3B5cmlnaHQgKGMpIDIwMjYgQnJvYWRjb20uIEFsbCBSaWdodHMgUmVzZXJ2ZWQuCiMgQnJvYWRjb20gQ29uZmlkZW50aWFsLiBUaGUgdGVybSAiQnJvYWRjb20iIHJlZmVycyB0byBCcm9hZGNvbSBJbmMuCiMgYW5kL29yIGl0cyBzdWJzaWRpYXJpZXMuCgojIENyZWF0ZSBjdXN0b20gcHJvZmlsZSBkaXJlY3RvcnkKbWtkaXIgLXAgL2V0Yy92bXdhcmUtcHJlbHVkZS9wcm9maWxlcy9uZXR0eS1uby1kaXJlY3QtbWVtb3J5LwoKIyBDcmVhdGUgdGhlIHJlcXVpcmVkIGRpcmVjdG9yeSB0cmVlIHRoYXQgd2lsbCBiZSB1c2VkIHdoZW4gdGhlIHByb2ZpbGUgaXMgYWN0aXZlCm1rZGlyIC1wIC9ldGMvdm13YXJlLXByZWx1ZGUvcHJvZmlsZXMvbmV0dHktbm8tZGlyZWN0LW1lbW9yeS9oZWxtL3ByZWx1ZGVfcHJvdmlzaW9uaW5nLXNlcnZpY2UvCgojIENyZWF0ZSAiY2hlY2siIGZpbGUgdGhhdCBpcyBhbiBleGVjdXRhYmxlIGZpbGUgcnVuIGJ5IGRlcGxveSBzY3JpcHQKY2F0IDw8RU9GID4gL2V0Yy92bXdhcmUtcHJlbHVkZS9wcm9maWxlcy9uZXR0eS1uby1kaXJlY3QtbWVtb3J5L2NoZWNrCiMhL2Jpbi9iYXNoCmV4aXQgMApFT0YKY2htb2QgNzU1IC9ldGMvdm13YXJlLXByZWx1ZGUvcHJvZmlsZXMvbmV0dHktbm8tZGlyZWN0LW1lbW9yeS9jaGVjawoKIyBDb3B5IHByb3Zpc2lvbmluZy1zZXJ2aWNlIGNvbmZpZ3VyYXRpb24gZmlsZSB0byB0aGUgY3VzdG9tIHByb2ZpbGUKY2F0IDw8RU9GID4gL2V0Yy92bXdhcmUtcHJlbHVkZS9wcm9maWxlcy9uZXR0eS1uby1kaXJlY3QtbWVtb3J5L2hlbG0vcHJlbHVkZV9wcm92aXNpb25pbmctc2VydmljZS85MC1yZXNvdXJjZXMueWFtbApuZXR0eU5vUHJlZmVyRGlyZWN0OiB0cnVlCm1heERpcmVjdE1lbW9yeVNpemU6ICIyNTZtIgpqYXZhT3B0czoKICAiaW8ubmV0dHkubWF4RGlyZWN0TWVtb3J5IjogIjAiCkVPRgpjaG1vZCA2NDQgL2V0Yy92bXdhcmUtcHJlbHVkZS9wcm9maWxlcy9uZXR0eS1uby1kaXJlY3QtbWVtb3J5L2hlbG0vcHJlbHVkZV9wcm92aXNpb25pbmctc2VydmljZS85MC1yZXNvdXJjZXMueWFtbAo= | bash -'
Apply the profile by running the following on one vRA node:
/opt/scripts/deploy.shVerify after the restart, monitor pod stability:
kubectl -n prelude get pods -l app=provisioning-service-appkubectl -n prelude describe pod <provisioning-service-app-pod-id>Revert (if needed):
vracli cluster exec -- bash -c 'rm -rf /etc/vmware-prelude/profiles/netty-no-direct-memory'/opt/scripts/deploy.sh
Note:
If vco-app (vRO) pods are also restarting frequently after applying Aria Automation 8.18.1 Patch 4, This is can be addressed by upgrading the vSphere Plugin to version 8.2.1
Reference KB: 432637