Class NvidiaServiceSettings.Builder
java.lang.Object
co.elastic.clients.util.ObjectBuilderBase
co.elastic.clients.util.WithJsonObjectBuilderBase<NvidiaServiceSettings.Builder>
co.elastic.clients.elasticsearch.inference.NvidiaServiceSettings.Builder
- All Implemented Interfaces:
WithJson<NvidiaServiceSettings.Builder>,ObjectBuilder<NvidiaServiceSettings>
- Enclosing class:
- NvidiaServiceSettings
public static class NvidiaServiceSettings.Builder
extends WithJsonObjectBuilderBase<NvidiaServiceSettings.Builder>
implements ObjectBuilder<NvidiaServiceSettings>
Builder for
NvidiaServiceSettings.-
Constructor Summary
Constructors -
Method Summary
Modifier and TypeMethodDescriptionRequired - A valid API key for your Nvidia endpoint.build()Builds aNvidiaServiceSettings.maxInputTokens(Integer value) For atext_embeddingtask, the maximum number of tokens per input.Required - The name of the model to use for the inference task.rateLimit(RateLimitSetting value) This setting helps to minimize the number of rate limit errors returned from the Nvidia API.This setting helps to minimize the number of rate limit errors returned from the Nvidia API.protected NvidiaServiceSettings.Builderself()similarity(NvidiaSimilarityType value) For atext_embeddingtask, the similarity measure.The URL of the Nvidia model endpoint.Methods inherited from class co.elastic.clients.util.WithJsonObjectBuilderBase
withJsonMethods inherited from class co.elastic.clients.util.ObjectBuilderBase
_checkSingleUse, _listAdd, _listAddAll, _mapPut, _mapPutAll
-
Constructor Details
-
Builder
public Builder()
-
-
Method Details
-
apiKey
Required - A valid API key for your Nvidia endpoint. Can be found inAPI Keyssection of Nvidia account settings.API name:
api_key -
url
The URL of the Nvidia model endpoint. If not provided, the default endpoint URL is used depending on the task type:- For
text_embeddingtask -https://integrate.api.nvidia.com/v1/embeddings. - For
completionandchat_completiontasks -https://integrate.api.nvidia.com/v1/chat/completions. - For
reranktask -https://ai.api.nvidia.com/v1/retrieval/nvidia/reranking.
API name:
url - For
-
modelId
Required - The name of the model to use for the inference task. Refer to the model's documentation for the name if needed. Service has been tested and confirmed to be working with the following models:- For
text_embeddingtask -nvidia/llama-3.2-nv-embedqa-1b-v2. - For
completionandchat_completiontasks -microsoft/phi-3-mini-128k-instruct. - For
reranktask -nv-rerank-qa-mistral-4b:1. Service doesn't supporttext_embeddingtaskbaai/bge-m3andnvidia/nvclipmodels due to them not recognizing theinput_typeparameter.
API name:
model_id - For
-
maxInputTokens
For atext_embeddingtask, the maximum number of tokens per input. Inputs exceeding this value are truncated prior to sending to the Nvidia API.API name:
max_input_tokens -
similarity
For atext_embeddingtask, the similarity measure. One of cosine, dot_product, l2_norm.API name:
similarity -
rateLimit
This setting helps to minimize the number of rate limit errors returned from the Nvidia API. By default, thenvidiaservice sets the number of requests allowed per minute to 3000.API name:
rate_limit -
rateLimit
public final NvidiaServiceSettings.Builder rateLimit(Function<RateLimitSetting.Builder, ObjectBuilder<RateLimitSetting>> fn) This setting helps to minimize the number of rate limit errors returned from the Nvidia API. By default, thenvidiaservice sets the number of requests allowed per minute to 3000.API name:
rate_limit -
self
- Specified by:
selfin classWithJsonObjectBuilderBase<NvidiaServiceSettings.Builder>
-
build
Builds aNvidiaServiceSettings.- Specified by:
buildin interfaceObjectBuilder<NvidiaServiceSettings>- Throws:
NullPointerException- if some of the required fields are null.
-