CAJVO

Sprawdziliśmy NVIDIA Nemotron 3 Embed lokalnie. Jak wypada na tle Qwen3-Embedding-8B?

NVIDIA Nemotron 3 Embed to nowy model embeddingowy zaprojektowany z myślą o wyszukiwaniu semantycznym, RAG i systemach agentowych. Sprawdziliśmy lokalnie, jak jego wariant 8B wypada na tle Qwen3-Embedding-8B pod względem jakości retrievalu, szybkości działania i wykorzystania pamięci na MacBooku Pro z M4 Pro.

Czym jest NVIDIA Nemotron 3 Embed

Nemotron 3 Embed to rodzina modeli embeddingowych opracowanych przez NVIDIA z myślą o wyszukiwaniu semantycznym, retrievalu oraz systemach RAG. W przeciwieństwie do modeli generatywnych nie tworzą one odpowiedzi na pytanie użytkownika. Ich zadaniem jest przekształcenie tekstu w reprezentację liczbową, czyli wektor, który pozwala porównywać znaczenie zapytań i dokumentów.

NVIDIA udostępniła rodzinę Nemotron 3 Embed 16 lipca 2026 roku. Największy wariant, Nemotron-3-Embed-8B-BF16, ma około 8 miliardów parametrów i bazuje na architekturze Ministral 3. Producent przekształcił pierwotny model typu causal decoder w dwukierunkowy enkoder, dzięki czemu podczas tworzenia reprezentacji może analizować pełny kontekst wejściowego tekstu. Końcowy embedding powstaje przez uśrednienie reprezentacji tokenów i standardowo ma 4096 wymiarów.

Model obsługuje tekst o długości do 32 768 tokenów. Pozwala również zmniejszać liczbę wymiarów embeddingu, na przykład do 2048 lub 1024, co może ograniczyć rozmiar indeksu wektorowego kosztem części informacji zawartej w reprezentacji. W lokalnych przykładach użycia NVIDIA rozróżnia zapytania i dokumenty za pomocą prefiksów query: oraz passage:. Sposób przygotowania wejścia ma więc znaczenie dla poprawnego wykorzystania modelu w zadaniach retrievalowych.

W chwili premiery wariant 8B osiągnął 78,5 proc. w benchmarku RTEB i zajmował w nim pierwsze miejsce. NVIDIA raportowała również wynik 75,5 proc. w części retrieval benchmarku MMTEB. Wyniki laboratoryjne nie przesądzają jednak o przewadze w konkretnym zastosowaniu. Jakość retrievalu zależy również od charakteru danych, sposobu przygotowania zapytań, długości dokumentów i środowiska, w którym model jest uruchamiany. Dlatego zamiast opierać się wyłącznie na rankingu producenta, zestawiliśmy Nemotron 3 Embed z Qwen3-Embedding-8B w tym samym lokalnym środowisku.

Jak przeprowadziliśmy test

Porównanie przeprowadziliśmy lokalnie na MacBooku Pro wyposażonym w układ Apple M4 Pro i 48 GB pamięci zunifikowanej. Oba modele działały przez Ollamę, dzięki czemu korzystały z tego samego środowiska uruchomieniowego i tego samego mechanizmu generowania embeddingów.

Do testu wybraliśmy modele z tej samej klasy wielkości i w tej samej kwantyzacji. Qwen3-Embedding-8B miał 7,6 mld parametrów, natomiast testowany wariant Nemotron 3 Embed 7,95 mld. Oba działały jako pliki GGUF w kwantyzacji Q4_K_M i zwracały wektory o 4096 wymiarach. W przypadku Nemotrona wykorzystaliśmy społecznościową konwersję GGUF przygotowaną na podstawie oficjalnego modelu NVIDIA Nemotron-3-Embed-8B-BF16. Ten szczegół ma znaczenie, ponieważ NVIDIA nie udostępnia obecnie testowanego przez nas wariantu Q4_K_M jako własnego artefaktu GGUF.

Nie wymuszaliśmy identycznego tekstowego prefiksu dla obu modeli. Zamiast tego każdy z nich otrzymywał dane zgodnie ze sposobem użycia przewidzianym przez jego twórców. Nemotron rozróżnia zapytania i dokumenty za pomocą oznaczeń query: oraz passage:, natomiast Qwen3-Embedding obsługuje instrukcje po stronie zapytania. Takie podejście pozwala porównywać modele w konfiguracji zbliżonej do ich rzeczywistego zastosowania, zamiast celowo ograniczać jeden z nich przez niewłaściwy format wejścia.

Właściwe porównanie przeprowadziliśmy na deterministycznym podzbiorze SciFact, jednego ze zbiorów wykorzystywanych w benchmarku BEIR. Nasza wersja obejmowała 1000 dokumentów i 100 zapytań. Dla każdego zapytania zachowaliśmy dokumenty oznaczone jako trafne, a pozostałą część korpusu stanowiły dokumenty rozpraszające wybrane niezależnie od wyników obu modeli. Zestaw został ustalony przed wykonaniem właściwego testu i nie był później modyfikowany pod kątem uzyskanych rezultatów. BEIR jest publicznym frameworkiem przeznaczonym do porównywania systemów wyszukiwania informacji na zróżnicowanych zbiorach danych.

Dla każdego dokumentu i zapytania generowaliśmy embedding, a następnie porządkowaliśmy dokumenty według podobieństwa cosinusowego. Ollama zwraca z endpointu /api/embed wektory znormalizowane do długości jednostkowej, co pozwala bezpośrednio wykorzystywać je w wyszukiwaniu opartym na podobieństwie.

Jakość retrievalu ocenialiśmy między innymi za pomocą Recall@1, Recall@3, Recall@5, Recall@10, MRR@10, nDCG@10 oraz MAP@10. W teście nie stosowaliśmy rerankera ani dodatkowego modelu językowego. O wyniku decydowała wyłącznie kolejność dokumentów zwracana na podstawie embeddingów.

Osobno zmierzyliśmy wydajność lokalną, w tym opóźnienie pojedynczego zapytania, przepustowość podczas przetwarzania dokumentów oraz maksymalne zaobserwowane wykorzystanie pamięci przez Ollamę. Dzięki temu można było ocenić nie tylko jakość wyszukiwania, lecz także koszt jej uzyskania na tym samym komputerze.

Nemotron 3 Embed vs Qwen3-Embedding-8B: jakość retrievalu

Właściwy test na zbiorze SciFact Lite pokazał niewielką, ale konsekwentną przewagę Nemotron 3 Embed w większości analizowanych miar jakości wyszukiwania. Różnica nie była jednak na tyle duża, aby na podstawie jednego eksperymentu uznać jeden z modeli za bezsprzecznie lepszy.

Wyniki jakości retrievalu modeli Qwen3-Embedding-8B i Nemotron 3 Embed 8B na zbiorze SciFact Lite. Źródło: test własny CAJVO.

Metryka

Qwen3-Embedding-8B

Nemotron 3 Embed 8B

Recall@1

0,7828

0,7928

Recall@3

0,9035

0,9385

Recall@5

0,9350

0,9500

Recall@10

0,9500

0,9500

MRR@10

0,8734

0,8883

nDCG@10

0,8917

0,9052

MAP@10

0,8709

0,8892

MAP@100

0,8725

0,8920

Największą różnicę odnotowaliśmy dla Recall@3. Nemotron osiągnął wynik 0,9385 wobec 0,9035 dla Qwena, co oznacza przewagę o 3,5 punktu procentowego. Innymi słowy, trafne dokumenty częściej znajdowały się w pierwszej trójce wyników zwracanych przez model NVIDIA.

Im głębiej analizowaliśmy ranking, tym różnica malała. Przy Recall@10 oba modele osiągnęły dokładnie 0,95, a przy Recall@100 wynik wynosił 1,0. Oznacza to, że oba modele ostatecznie odnajdywały właściwe materiały równie skutecznie. Nemotron częściej umieszczał je jednak wyżej na liście wyników.

Podobny obraz daje MRR@10, które uwzględnia pozycję pierwszego trafnego rezultatu. Nemotron uzyskał 0,8883, podczas gdy Qwen 0,8734. Również nDCG@10, uwzględniające jakość całego uporządkowania pierwszych dziesięciu wyników, przemawiało na korzyść modelu NVIDIA: 0,9052 wobec 0,8917.

Przewaga pojawiła się także w MAP. Dla pierwszych dziesięciu rezultatów Nemotron osiągnął 0,8892, a Qwen 0,8709. Przy MAP@100 wyniki wyniosły odpowiednio 0,8920 oraz 0,8725.

Same średnie nie pokazują jednak całego obrazu. Analiza wyników dla poszczególnych zapytań wykazała, że w zależności od metryki od 90 do 98 proc. przypadków kończyło się remisem. W przypadku nDCG@10 Nemotron osiągnął lepszy wynik dla 8 zapytań, Qwen dla 2, natomiast pozostałych 90 nie różniło obu modeli.

Przeprowadzona przez nas analiza bootstrapowa również sugeruje ostrożność w interpretacji rezultatów. Dla głównych miar jakości rankingu, takich jak nDCG@10, MRR@10 i MAP@10, 95-procentowe przedziały bootstrapowe dla różnicy obejmowały zero. Na podstawie tej próby nie możemy więc mówić o jednoznacznie potwierdzonej przewadze Nemotrona w ogólnej jakości rankingu.

Porównanie Recall@1, Recall@3, MRR@10, nDCG@10 i MAP@10 dla Nemotron 3 Embed 8B oraz Qwen3-Embedding-8B.
Porównanie Recall@1, Recall@3, MRR@10, nDCG@10 i MAP@10 dla Nemotron 3 Embed 8B oraz Qwen3-Embedding-8B.

Najsilniejszy sygnał pojawił się ponownie przy Recall@3. W tej metryce Nemotron wygrał dla czterech zapytań i nie przegrał żadnego, a oszacowany przedział bootstrapowy dla różnicy wynosił od około 0,005 do 0,075. Nadal jest to jednak niewielka liczba przypadków, dlatego wynik należy traktować jako wskazówkę, a nie dowód ogólnej wyższości modelu.

W naszym eksperymencie Nemotron 3 Embed był więc nieco skuteczniejszy przede wszystkim tam, gdzie liczyło się umieszczenie właściwego dokumentu możliwie wysoko w rankingu. Qwen3-Embedding-8B pozostawał bardzo blisko, a przy Recall@10 oba modele osiągnęły identyczny wynik 0,95.

Wydajność lokalna na MacBooku Pro M4 Pro

Jakość retrievalu to tylko jedna część porównania. W lokalnym zastosowaniu znaczenie mają również czas odpowiedzi, szybkość przetwarzania większej liczby dokumentów oraz wykorzystanie zasobów komputera. Oba modele sprawdziliśmy w tym samym środowisku, na MacBooku Pro z układem M4 Pro i 48 GB pamięci zunifikowanej.

Wyniki lokalnego testu wydajności na MacBooku Pro M4 Pro z 48 GB pamięci zunifikowanej.

Metryka

Qwen3-Embedding-8B

Nemotron 3 Embed 8B

Mediana opóźnienia pojedynczego zapytania

165,5 ms

179,5 ms

P95 opóźnienia

175,9 ms

192,9 ms

Przepustowość dokumentów

5,65 dok./s

5,42 dok./s

Szczytowy sumaryczny RSS procesów Ollamy

10,28 GiB

13,36 GiB

Qwen3-Embedding-8B osiągnął niższe opóźnienia przy pojedynczych zapytaniach. Mediana wyniosła około 165,5 ms wobec 179,5 ms dla Nemotrona, co oznacza wynik niższy o około 7,8 proc. Podobna zależność wystąpiła dla 95. percentyla: 175,9 ms w przypadku Qwena i 192,9 ms dla modelu NVIDIA.

Różnica w przepustowości była mniejsza. Qwen przetwarzał średnio około 5,65 dokumentu na sekundę, a Nemotron około 5,42. Odpowiada to przewadze Qwena rzędu 4,4 proc. w tym konkretnym środowisku testowym.

Podczas właściwego testu jakościowego wygenerowanie embeddingów dla korpusu liczącego 1000 dokumentów zajęło Qwenowi około 860 sekund, czyli 14 minut i 20 sekund. Nemotron wykonał to samo zadanie w około 871 sekund, czyli 14 minut i 31 sekund. Różnica wyniosła niespełna 11 sekund, około 1,3 proc. całkowitego czasu przetwarzania.

Większy kontrast pojawił się w pomiarze RSS. Maksymalna suma pamięci rezydentnej procesów Ollamy zaobserwowana podczas testu wyniosła około 10,28 GiB dla Qwena oraz 13,36 GiB dla Nemotrona. W drugim przypadku wartość była więc o około 3,08 GiB, czyli 30 proc., wyższa.

Tego pomiaru nie należy utożsamiać z ilością pamięci zajmowanej wyłącznie przez wagi modelu ani z całkowitym wykorzystaniem pamięci zunifikowanej komputera. Benchmark rejestrował sumaryczny RSS procesów Ollamy, dlatego wynik opisuje zachowanie naszej konkretnej konfiguracji i służy przede wszystkim do porównania obu modeli w jednakowych warunkach.

W lokalnym teście Qwen3-Embedding-8B okazał się zatem nieco szybszy, a podczas pomiaru RSS wymagał mniej zasobów. Różnica w tempie przetwarzania dokumentów była jednak niewielka. Zestawienie tych rezultatów z wcześniejszym testem jakości pokazuje wyraźny kompromis: Nemotron osiągnął nieco lepsze wyniki retrievalu, natomiast Qwen zapewnił niższe opóźnienia i korzystniejszy wynik w pomiarze wykorzystania pamięci.

Co wyniki oznaczają w praktyce

W naszym teście Nemotron 3 Embed częściej umieszczał trafne dokumenty wysoko w rankingu, co może mieć znaczenie w systemach RAG korzystających z niewielkiej liczby najlepszych wyników. Największą przewagę odnotowaliśmy przy Recall@3.

Qwen3-Embedding-8B był natomiast szybszy i korzystniej wypadał pod względem wykorzystania pamięci. Przy Recall@10 oba modele osiągnęły identyczny wynik 0,95, dlatego w systemach wykorzystujących większą liczbę kandydatów lub dodatkowy reranker różnica jakościowa może mieć mniejsze znaczenie.

W praktyce wybór powinien zależeć od konkretnego zastosowania. Nemotron może być ciekawszy tam, gdzie liczy się jakość pierwszych wyników, natomiast Qwen pozostaje bardzo konkurencyjny przy nacisku na szybkość i oszczędność zasobów.

Który model wybrać?

Na podstawie naszego testu nie ma jednego oczywistego zwycięzcy. Nemotron 3 Embed osiągnął nieco lepsze wyniki jakościowe, szczególnie przy pierwszych pozycjach rankingu. Qwen3-Embedding-8B działał natomiast szybciej i zużywał mniej pamięci.

Jeżeli priorytetem jest jakość retrievalu w TOP 3, wybralibyśmy Nemotrona. Jeśli ważniejsze są niższe opóźnienia i mniejsze wymagania sprzętowe, Qwen pozostaje bardziej praktycznym wyborem.

W obu przypadkach ostateczna decyzja powinna wynikać z testu na własnych danych, a nie wyłącznie z publicznych benchmarków.

Podsumowanie

Test nie wskazał bezdyskusyjnego zwycięzcy, ale pokazał wyraźny podział mocnych stron obu modeli. Nemotron 3 Embed osiągnął lepsze wyniki jakościowe w większości analizowanych metryk i częściej umieszczał trafne dokumenty wysoko w rankingu. Qwen3-Embedding-8B był natomiast szybszy i korzystniej wypadał pod względem wykorzystania pamięci.

Jeżeli priorytetem jest maksymalizacja jakości pierwszych wyników retrievalu, Nemotron 3 Embed jest w naszym teście lepszym wyborem. Jeżeli większe znaczenie mają szybkość działania, efektywność zasobowa i nadal bardzo wysoka skuteczność wyszukiwania, bardziej praktycznym rozwiązaniem pozostaje Qwen3-Embedding-8B.

Najważniejszy wniosek jest jednak szerszy: wyboru modelu embeddingowego nie należy opierać wyłącznie na publicznych rankingach. Nawet niewielki test wykonany na docelowym sprzęcie i reprezentatywnych danych daje znacznie więcej informacji niż pojedynczy wynik benchmarkowy producenta.

Źródła

  1. AllenAI, SciFact: Fact or Fiction: Verifying Scientific Claims
  2. BEIR, A Heterogeneous Benchmark for Information Retrieval
  3. NVIDIA, Nemotron-3-Embed-8B-BF16, Model Card
  4. Qwen, Qwen3-Embedding-8B, Model Card
  5. Ollama, Embeddings