Prometheus Metrics Available
Observability is a cornerstone of any production-grade speech platform. Capacity Private Cloud exposes a comprehensive set of Prometheus metrics across every microservice, giving operations teams deep visibility into system health, resource utilization, and request-level performance. Whether you are building Grafana dashboards, configuring alerting rules, or capacity planning for scale, these metrics provide the telemetry foundation you need.
The metrics below follow Prometheus conventions:
| Type | Meaning |
|---|---|
| counter | Cumulative total that only ever increases. |
| gauge | A single point-in-time value that rises and falls. |
| histogram | Distribution of request duration or size across configurable buckets. |
| gauge vector | Not a distinct Prometheus type — a gauge exposed as multiple labeled time series (e.g. one per response type or status) rather than a single value. |
Admin Portal
Web administration portal used to manage the platform.
| Metric | Type | Description |
|---|---|---|
admin_portal_total_requests | counter | Total number of admin portal requests |
admin_portal_average_request_process_time_dist | histogram | Distribution of average request processing time |
Archive
Archives call/session data and recordings, and executes archive requests.
| Metric | Type | Description |
|---|---|---|
archive_total_requests | counter | Total number of requests received |
archive_active_requests | gauge | Total number of active requests |
archive_average_request_process_time_dist | histogram | Distribution of average request processing time |
archive_total_responses_returned | gauge vector | Number of responses returned |
archive_active_execution | gauge | Total number of active archive requests currently being executed |
archive_requests_max | gauge | Maximum number of archive requests received |
archive_total_execute | counter | Total number of archive requests executed |
ASR (Automatic Speech Recognition)
Performs automatic speech recognition, including streaming/batch transcription.
| Metric | Type | Description |
|---|---|---|
asr_total_asr_requests | counter | Total number of requests received |
asr_active_asr_requests | gauge | Total number of active requests |
asr_active_europa_requests | gauge | Total number of active backend engine requests |
asr_average_asr_request_process_time_dist | histogram | Distribution of average request processing time |
asr_max_asr_requests | gauge | Maximum number of simultaneous ASR requests |
asr_total_asr_responses_returned | gauge vector | Number of responses returned by the container |
asr_total_grammar_requests | counter | Total number of grammar load requests received |
asr_active_grammar_load_requests | gauge | Total number of active grammar load requests |
asr_average_asr_stream_request_process_time_dist | histogram | Distribution of average stream request processing time |
asr_max_concurrent_grammar_load_requests | gauge | Maximum number of simultaneously active grammar load requests |
asr_average_grammar_load_request_process_time_dist | histogram | Distribution of average grammar load request processing time |
asr_total_grammar_load_responses_returned | gauge vector | Number of grammar load responses returned by the container |
asr_total_transcription_requests | counter | Total number of transcription requests received |
asr_active_transcription_requests | gauge | Total number of active transcription requests |
asr_total_transcription_responses_returned | gauge vector | Number of transcription responses returned |
asr_average_asr_batch_request_process_time_dist | histogram | Distribution of average batch request processing time |
asr_average_transcription_batch_request_process_time_dist | histogram | Distribution of average transcription batch request processing time |
asr_average_transcription_stream_request_process_time_dist | histogram | Distribution of average transcription stream request processing time |
asr_max_transcription_requests | gauge | Maximum number of simultaneous transcription requests |
asr_max_active_grammars | gauge | Maximum number of simultaneously active grammars |
asr_max_active_parses | gauge | Maximum number of simultaneous active SISR parses |
asr_active_decodes | gauge | Active number of decodes being processed |
asr_active_grammars | gauge | Active number of grammars being processed |
asr_active_parses | gauge | Active number of SISR parses being processed |
asr_average_sisr_parse_text_request_process_time_dist | histogram | Distribution of average SISR parse request processing time |
asr_sisr_parse_text_requests_total | counter | Total number of SISR parse requests received |
asr_total_sisr_parse_text_responses_returned | gauge vector | Number of SISR parse responses returned |
asr_total_ms_audio_pushed | counter | Total milliseconds of audio pushed into ASR |
asr_cache_entries | counter | Number of entries currently present in the ASR grammar cache |
asr_cache_size_bytes | counter | Current size in bytes of the grammar cache |
asr_active_ms_audio_processing | gauge | Total milliseconds of audio currently being processed by ASR |
asr_fine_tuned_results | gauge vector | ASR fine-tuned model results (if enabled) |
Binary Storage
Stores and serves binary artifacts used by other platform services.
| Metric | Type | Description |
|---|---|---|
binary_storage_total_requests | counter | Total number of requests received |
binary_storage_active_requests | gauge | Total number of active requests |
binary_storage_max_requests | gauge | Maximum number of binary storage requests |
binary_storage_average_request_process_time_dist | histogram | Distribution of average request processing time |
Configuration
Serves and manages runtime configuration for platform services.
| Metric | Type | Description |
|---|---|---|
configuration_total_requests | counter | Total number of requests received |
configuration_active_requests | gauge | Total number of active requests |
configuration_max_requests | gauge | Maximum number of configuration requests |
configuration_average_request_process_time_dist | histogram | Distribution of average request processing time |
configuration_total_responses_returned | gauge vector | Number of responses returned |
Deployment
Hosts and runs the speech engine containers, tracking active deployments and request throughput.
| Metric | Type | Description |
|---|---|---|
deployment_active_count | gauge | Number of active deployments |
deployment_total_responses_returned | gauge vector | Number of responses returned by the container |
deployment_active_requests | gauge | Total number of active requests |
deployment_average_request_process_time | histogram | Distribution of average request processing time |
deployment_max_requests | gauge | Maximum number of simultaneous deployment requests |
deployment_total_requests | counter | Total number of deployment requests |
Deployment Portal
Web portal used to manage service deployments.
| Metric | Type | Description |
|---|---|---|
deployment_portal_total_requests | counter | Total number of deployment portal requests |
deployment_portal_active_requests | gauge | Total number of active deployment portal requests |
deployment_portal_requests_max | gauge | Maximum number of deployment portal requests |
deployment_portal_average_request_process_time_dist | histogram | Distribution of average request processing time |
deployment_portal_total_responses_returned | gauge vector | Number of responses returned |
Diarization
Identifies and separates individual speakers within an audio stream.
| Metric | Type | Description |
|---|---|---|
diarization_average_request_process_time_dist | histogram | Distribution of average request processing time |
diarization_active_requests | gauge | Total number of active requests |
diarization_total_requests | counter | Total number of initial requests received |
Filestore
Stores and caches deployment artifacts, exposing its own HTTP-facing metrics.
| Metric | Type | Description |
|---|---|---|
filestore_active_deployments | gauge | Current number of active deployments managed by the file-store service |
filestore_cache_memory_bytes | gauge | Current memory consumption of the file-store cache in bytes |
filestore_cache_size | gauge | Current number of items in the file-store cache |
filestore_cache_reconciliation | counter | Total number of cache reconciliation events |
filestore_deployment_cache_size | gauge | Current number of cached deployment artifacts/entries |
filestore_http_request_duration_seconds | histogram | Distribution of HTTP request latency in seconds |
filestore_http_requests_total | counter | Total number of HTTP requests received |
filestore_http_response_size_bytes | histogram | Distribution of HTTP response body sizes in bytes |
ITN (Inverse Text Normalization)
Converts spoken-form transcription output into written-form text (numbers, dates, currency, etc.).
| Metric | Type | Description |
|---|---|---|
itn_request_times | histogram | ITN request times |
itn_requests_current | gauge | Active ITN requests |
itn_requests_max | gauge | Maximum number of simultaneous ITN requests |
itn_requests | counter | Total ITN requests |
Language ID
Identifies the spoken language present in an audio stream.
| Metric | Type | Description |
|---|---|---|
lid_average_request_process_time_dist | histogram | Distribution of average request processing time |
lid_active_requests | gauge | Total number of active requests |
lid_total_requests | counter | Total number of initial requests received |
Licensing
Validates and syncs product license entitlements across deployments.
| Metric | Type | Description |
|---|---|---|
license_invalid_check_ops_total | counter | Total number of unsuccessful license check events |
license_sync_fail_ops_total | counter | Total number of unsuccessful license sync events |
license_sync_ops_total | counter | Total number of attempted license sync events |
license_sync_success_ops_total | counter | Total number of successful license sync events |
license_valid_check_ops_total | counter | Total number of successful license check events |
license_valid_licences | gauge | Number of valid license deployments |
license_invalid_licences | gauge | Number of invalid license deployments |
LumenVox API
Primary API gateway that fronts client requests and sessions.
| Metric | Type | Description |
|---|---|---|
lumenvox_api_total_requests | counter | Total number of initial requests received |
lumenvox_api_total_requests_within_sessions | counter | Total number of API requests within sessions |
lumenvox_api_active_requests | gauge | Total number of active requests |
lumenvox_api_total_responses_returned | gauge vector | Number of responses returned by the container |
lumenvox_api_rmq_messages_received | counter | Number of LumenVox API RabbitMQ messages received |
lumenvox_api_rmq_messages_sent | counter | Number of LumenVox API RabbitMQ messages sent |
MRCP
MRCP server handling SIP/RTSP call signaling into the speech platform. This service acts as a bridge between MRCP and the LumenVox API.
| Metric | Type | Description |
|---|---|---|
mrcp_total_requests | counter | Total number of calls (sessions) received |
mrcp_active_requests | gauge | Total number of active requests |
mrcp_average_request_process_time_dist | histogram | Distribution of average request processing time |
mrcp_total_responses_returned | gauge vector | Number of responses returned |
mrcp_max_calls | gauge | Maximum simultaneous number of calls processed |
mrcp_sip_calls | counter | Total number of SIP calls processed |
mrcp_sip_tcp_connections | counter | Total number of SIP TCP calls processed |
mrcp_rtsp_calls | counter | Total number of RTSP calls processed |
mrcp_garbage_collection_calls | gauge | Total ended calls that are in the process of garbage collection |
Neuron
processes text to determine intents and entities.
| Metric | Type | Description |
|---|---|---|
neuron_total_requests | counter | Total number of Neuron requests received |
neuron_active_requests | gauge | Total number of active Neuron requests |
neuron_active_requests_process_time_dist | histogram | Distribution of average Neuron request processing time |
neuron_first_result_time_dist | histogram | Distribution of time to first audio byte in milliseconds |
neuron_first_result_time_max | gauge | Maximum time to first audio byte in milliseconds |
neuron_first_result_time_min | gauge | Minimum time to first audio byte in milliseconds |
neuron_max_queue_size_requests | gauge | Maximum simultaneous Neuron requests at any one time since startup |
neuron_total_responses_returned | gauge vector | Number of responses returned including type |
NLU (Natural Language Understanding)
Extracts intents and entities from recognized or input text.
| Metric | Type | Description |
|---|---|---|
nlu_average_request_process_time_dist | histogram | Distribution of average request processing time |
nlu_active_requests | gauge | Total number of active requests |
nlu_total_requests | counter | Total number of initial requests received |
nlu_total_responses_returned | gauge vector | Number of responses returned by the container |
Reporting
Generates operational and usage reports.
| Metric | Type | Description |
|---|---|---|
reporting_total_requests | counter | Total number of requests received |
reporting_active_requests | gauge | Total number of active requests |
reporting_average_request_process_time_dist | histogram | Distribution of average request processing time |
reporting_requests_max | gauge | Maximum number of reporting requests |
Resource Manager
Downloads and installs ASR, TTS, VB-Active, DNN, and ITN language/model packages.
| Metric | Type | Description |
|---|---|---|
resource_active_asr_installs | gauge | Actively installing ASR packages |
resource_asr_download_attempts_counter_total | counter | Total number of ASR download attempts |
resource_asr_download_failure_counter_total | counter | Total number of failed ASR downloads |
resource_asr_download_success_counter_total | counter | Total number of successful ASR downloads |
resource_asr_language_packages_configured | gauge | Number of ASR packages configured for the system |
resource_tts_active_installs | gauge | Actively installing TTS packages |
resource_tts_download_attempts_counter_total | counter | Total number of TTS download attempts |
resource_tts_download_failure_counter_total | counter | Total number of failed TTS downloads |
resource_tts_download_success_counter_total | counter | Total number of successful TTS downloads |
resource_tts_voice_packages_configured | gauge | Number of TTS packages configured for the system |
resource_active_vb_active_installs | gauge | Actively installing VB-Active packages |
resource_vb_active_download_attempts_counter_total | counter | Total number of VB-Active download attempts |
resource_vb_active_download_failure_counter_total | counter | Total number of failed VB-Active downloads |
resource_vb_active_download_success_counter_total | counter | Total number of successful VB-Active downloads |
resource_vb_active_language_packages_configured | gauge | Number of VB-Active packages configured for the system |
resource_dnn_active_installs | gauge | Actively installing DNN packages |
resource_dnn_download_attempts_counter_total | counter | Total number of DNN download attempts |
resource_dnn_download_failure_counter_total | counter | Total number of failed DNN downloads |
resource_dnn_download_success_counter_total | counter | Total number of successful DNN downloads |
resource_dnn_voice_packages_configured | gauge | Number of DNN packages configured for the system |
resource_itn_active_installs | counter | Total number of ITN resource installs |
resource_itn_download_attempts_counter_total | counter | Total number of ITN download attempts |
Session
Manages the lifecycle of client sessions across the platform.
| Metric | Type | Description |
|---|---|---|
session_total_requests | counter | Total number of requests received |
session_active_requests | gauge | Total number of active requests |
session_average_request_process_time_dist | histogram | Distribution of average request processing time |
session_total_responses_returned | gauge vector | Number of responses returned by the container |
TTS (Text-to-Speech)
Synthesizes speech audio from text, including queueing and first-audio-byte latency tracking.
| Metric | Type | Description |
|---|---|---|
tts_total_requests | counter | Total number of requests received |
tts_active_requests | gauge | Total number of active requests |
tts_average_request_process_time_dist | histogram | Distribution of average request processing time |
tts_total_responses_returned | gauge vector | Number of responses returned by the container |
tts_average_pending_queue_time | histogram | Average time of requests queued for processing |
tts_max_queue_size_synthesis_requests_tts1 | gauge | Maximum number of simultaneous TTS1 synthesis requests |
tts_active_queue_size_synthesis_requests_tts1 | gauge | Current number of simultaneous TTS1 synthesis requests |
tts_max_pending_requests_tts1 | counter | Maximum number of pending TTS1 synthesis requests |
tts_max_queue_size_synthesis_requests | gauge | Maximum TTS requests per container |
tts_first_result_time_max | histogram | Maximum time between client making synthesis request and receiving first audio packet |
tts_first_result_time_min | histogram | Minimum time between client making synthesis request and receiving first audio packet |
VAD (Voice Activity Detection)
Detects voice activity within an audio stream and routes it into CPA, AMD, ASR, and transcription sub-flows.
| Metric | Type | Description |
|---|---|---|
vad_audio_streams_current | gauge | Active current VAD streams |
vad_audio_streams_max | gauge | Maximum concurrent number of VAD streams |
vad_audio_streams_total | counter | Total number of completed VAD streams |
vad_audio_timeout_total | counter | Total number of VAD stream timeouts |
vad_active_requests | gauge | Total number of active requests |
vad_total_cpa_requests | counter | Total number of CPA requests received |
vad_active_cpa_requests | gauge | Total number of active CPA requests |
vad_average_cpa_request_process_time_dist | histogram | Distribution of average CPA request processing time |
vad_total_cpa_responses_returned | gauge vector | Number of CPA responses returned |
vad_total_amd_requests | counter | Total number of AMD requests received |
vad_active_amd_requests | gauge | Total number of AMD active requests |
vad_average_amd_request_process_time_dist | histogram | Distribution of average AMD request processing time |
vad_total_amd_responses_returned | gauge vector | Number of responses returned |
vad_total_asr_requests | counter | Total number of ASR requests received |
vad_active_asr_requests | gauge | Total number of active ASR requests |
vad_average_asr_request_process_time_dist | histogram | Distribution of average ASR request processing time |
vad_total_responses_returned | gauge vector | Number of ASR responses returned |
vad_total_transcription_requests | counter | Total number of transcription requests received |
vad_active_transcription_requests | gauge | Total number of active transcription requests |
vad_average_transcription_request_process_time_dist | histogram | Distribution of average transcription request processing time |
vad_total_transcription_responses_returned | gauge vector | Number of transcription responses returned |
vad_stream_subscribe_duration | histogram | Histogram of latencies for Redis stream subscription |
vad_transcoding_duration | histogram | Histogram of latencies for transcoding audio chunks |
vad_processing_duration | histogram | Histogram of latencies for engine processing of audio chunks |
