Multi-arch Docker image for serving BGE-M3 embeddings using llama.cpp. (Supports amd64 and arm64)
2.2K
This Docker image provides a multi-architecture (AMD64 & ARM64) server for generating text embeddings using the BGE-M3 model with llama.cpp. It exposes a simple API endpoint (/embedding) to retrieve 1024-dimensional embeddings for any input text.
Run the container:
docker run -d --name bge-m3-f16 -p 8080:8080 rbehzadan/bge-m3-f16
Send a request to get embeddings:
import requests
response = requests.post("http://localhost:8080/embedding", json={"content": "Hello, world!"})
embedding = response.json()[0]["embedding"][0]
print(embedding[:5]) # First 5 values
GitHub Repository: rbehzadan/bge-m3-f16
Content type
Image
Digest
sha256:bd1eb458a…
Size
1 GB
Last updated
over 1 year ago
docker pull rbehzadan/bge-m3-f16:v1.2.3