Business Tech Talks powered by BlueSoft Generative AI 29 minut słuchania

ChatGPT, Claude czy Gemini? Jak wybrać właściwy model?

W dzisiejszym odcinku podcastu „Business Tech Talks powered by BlueSoft” gościmy Rafała Bielickiego, Solutions Architecta w BlueSoft i autora pionierskiego projektu „MortAI Kombat”. Rozmawiamy o wynikach kompleksowego porównania pięciu wiodących modeli AI (ChatGPT, Claude, Gemini, Copilot i Meta AI), analizując ich wydajność w 47 zadaniach z 10 różnych kategorii, takich jak matematyka, debugowanie kodu czy tworzenie strategii biznesowych. Skupiamy się na tym, dlaczego nie istnieje jeden uniwersalny lider w dziedzinie sztucznej inteligencji, jakie zaskakujące błędy popełniają modele w analizie obrazu oraz jak organizacje powinny podchodzić do wyboru konkretnego „silnika” AI w zależności od specyfiki problemu. Poniżej znajduje się szczegółowy skrót transkrypcji odcinka.

Geneza projektu i metodologia badań 

Rafał Biliński zauważył, że na rynku brakuje kompleksowej publikacji, która rzetelnie porównywałaby wiodące modele AI. W ramach projektu „Mortal Kombat” przetestowano pięć modeli: ChatGPT, Claude, Gemini, Copilot oraz Meta AI 2. Metodologia opierała się na 47 zadaniach podzielonych na 10 kategorii, w tym matematykę, debugowanie kodu, pisanie kreatywne, strategie biznesowe, tłumaczenia oraz multimodalność (analizę obrazu). Wyniki końcowe były przeliczane za pomocą specjalnego wzoru, aby uzyskać obiektywny wynik liczbowy.

Kluczowy wniosek: Brak jednego lidera

Głównym przesłaniem rozmowy jest fakt, że nie istnieje jeden, uniwersalny model najlepszy we wszystkim. Rozwój AI nie przypomina sprintu do jednej mety, lecz sytuację, w której każdy model „biegnie w innym kierunku”, specjalizując się w innych dziedzinach. Dlatego wybór narzędzia powinien zależeć od konkretnego zadania, które ma ono wykonać.

Największe zaskoczenia: Multimodalność i Tłumaczenia 

  • Porażka w analizie obrazu: Żaden z modeli nie poradził sobie z prostą zagadką wizualną polegającą na wskazaniu koloru książki na regale na podstawie opisu jej położenia. Modele nie potrafiły poprawnie policzyć półek ani zidentyfikować obiekt, nawet po ręcznym zaznaczeniu go na obrazku przez autora.
  • Problemy Claude’a z naturalnością: Choć Claude jest uznawany za model wysokiej jakości, w kategorii tłumaczeń wypadł słabo, tworząc nienaturalne i „książkowe” teksty”.
  • Triumf Copilota w językach: Copilot, który w innych kategoriach był zazwyczaj „średniakiem”, okazał się bezkonkurencyjny w dziedzinie tłumaczeń.
Przeczytaj całość: ChatGPT, Claude czy Gemini? Jak wybrać właściwy model?

Balans między szybkością a jakością

W testach zaobserwowano wyraźną zależność: prędkość odpowiedzi jest często odwrotnie proporcjonalna do jej jakości.

  • Meta AI jest najszybszym modelem (odpowiedź w 30 sekund), ale często generuje bezużyteczny „strumień świadomości”, niepodzielony nawet na akapity.
  • Claude jest najwolniejszy (potrzebuje nawet 5 minut), ale dostarcza najbardziej pogłębione i wartościowe odpowiedzi.

Specyfika i „osobowości” modeli

Każdy z modeli wykazuje inne cechy charakterystyczne:

  • Claude („Gadatliwy profesor”): Idealny do złożonych analiz, architektur biznesowych i przygotowywania case’ów, gdzie ceni się styl i obszerność wypowiedzi.
  • ChatGPT (Najbardziej uniwersalny): Okazał się lepszy od Claude’a w zadaniach technicznych. Przy debugowaniu kodu Python był precyzyjniejszy i nie wprowadzał własnych błędów, co zdarzało się Claude’owi.
  • Gemini (Kreatywność vs Inżynieria): Świetny w zadaniach kreatywnych, ale radzi sobie znacznie gorzej, gdy wymagana jest wiedza inżynieryjna lub uwzględnienie właściwości fizycznych przedmiotów.

Kontrowersje etyczne i „cynizm” Gemini

Zaskakujące wyniki przyniósł test komunikacji kryzysowej (awaria baterii w dronach). Gemini jako jedyny wykazał się podejściem manipulacyjnym, priorytetyzując ochronę cen akcji i interesów akcjonariuszy nad pełną transparentnością wobec klientów. Model bronił swojego stanowiska w sposób cyniczny, tłumacząc, że działa z punktu widzenia dobra organizacji.

Rekomendacje dla użytkowników i biznesu

Rafał Biliński podkreśla, że modele AI nie są deterministyczne – ten sam prompt może dawać różne wyniki, a największym zagrożeniem jest brak przewidywalności błędów. Szczególną ostrożność należy zachować przy danych liczbowych i arytmetyce, które zawsze wymagają weryfikacji.

Dla organizacji optymalnym rozwiązaniem (zastosowanym np. w narzędziu Blue AI) jest wdrożenie platformy umożliwiającej wybór różnych silników AI. Rekomenduje się korzystanie z co najmniej dwóch różnych modeli, aby móc dopasować narzędzie do specyfiki aktualnego problemu.https://bluesoft.com/pl/usluga/sztuczna-inteligencja/asystenci-ai-i-automatyzacja-procesow

W naszym ebooku znajdziesz wyniki kompleksowego porównania 5 wiodących modeli AI, przeprowadzonego na 47 zadaniach biznesowych w 10 kategoriach.

Pobierz e-book „Jak testować i wybierać modele LLM w praktyce”

W tym odcinku wzięli udział:

Podcast

Zobacz inne odcinki podcastu “Business Tech Talks”

Odkryj nowe możliwości dla Twojego biznesu!

Dzięki BlueSoft zyskujesz dostęp do najnowszych technologii oraz wsparcia ekspertów, którzy chętnie dzielą się swoją wiedzą.

Skontaktuj się z nami!