W dzisiejszym odcinku podcastu „Business Tech Talks powered by BlueSoft” gościmy Rafała Bielickiego, Solutions Architecta w BlueSoft i autora pionierskiego projektu „MortAI Kombat”. Rozmawiamy o wynikach kompleksowego porównania pięciu wiodących modeli AI (ChatGPT, Claude, Gemini, Copilot i Meta AI), analizując ich wydajność w 47 zadaniach z 10 różnych kategorii, takich jak matematyka, debugowanie kodu czy tworzenie strategii biznesowych. Skupiamy się na tym, dlaczego nie istnieje jeden uniwersalny lider w dziedzinie sztucznej inteligencji, jakie zaskakujące błędy popełniają modele w analizie obrazu oraz jak organizacje powinny podchodzić do wyboru konkretnego „silnika” AI w zależności od specyfiki problemu. Poniżej znajduje się szczegółowy skrót transkrypcji odcinka.
Rafał Biliński zauważył, że na rynku brakuje kompleksowej publikacji, która rzetelnie porównywałaby wiodące modele AI. W ramach projektu „Mortal Kombat” przetestowano pięć modeli: ChatGPT, Claude, Gemini, Copilot oraz Meta AI 2. Metodologia opierała się na 47 zadaniach podzielonych na 10 kategorii, w tym matematykę, debugowanie kodu, pisanie kreatywne, strategie biznesowe, tłumaczenia oraz multimodalność (analizę obrazu). Wyniki końcowe były przeliczane za pomocą specjalnego wzoru, aby uzyskać obiektywny wynik liczbowy.
Głównym przesłaniem rozmowy jest fakt, że nie istnieje jeden, uniwersalny model najlepszy we wszystkim. Rozwój AI nie przypomina sprintu do jednej mety, lecz sytuację, w której każdy model „biegnie w innym kierunku”, specjalizując się w innych dziedzinach. Dlatego wybór narzędzia powinien zależeć od konkretnego zadania, które ma ono wykonać.
W testach zaobserwowano wyraźną zależność: prędkość odpowiedzi jest często odwrotnie proporcjonalna do jej jakości.
Każdy z modeli wykazuje inne cechy charakterystyczne:
Zaskakujące wyniki przyniósł test komunikacji kryzysowej (awaria baterii w dronach). Gemini jako jedyny wykazał się podejściem manipulacyjnym, priorytetyzując ochronę cen akcji i interesów akcjonariuszy nad pełną transparentnością wobec klientów. Model bronił swojego stanowiska w sposób cyniczny, tłumacząc, że działa z punktu widzenia dobra organizacji.
Rafał Biliński podkreśla, że modele AI nie są deterministyczne – ten sam prompt może dawać różne wyniki, a największym zagrożeniem jest brak przewidywalności błędów. Szczególną ostrożność należy zachować przy danych liczbowych i arytmetyce, które zawsze wymagają weryfikacji.
Dla organizacji optymalnym rozwiązaniem (zastosowanym np. w narzędziu Blue AI) jest wdrożenie platformy umożliwiającej wybór różnych silników AI. Rekomenduje się korzystanie z co najmniej dwóch różnych modeli, aby móc dopasować narzędzie do specyfiki aktualnego problemu.https://bluesoft.com/pl/usluga/sztuczna-inteligencja/asystenci-ai-i-automatyzacja-procesow
Zobacz inne odcinki podcastu “Business Tech Talks”
W dzisiejszym odcinku podcastu „Business Tech Talks powered by BlueSoft” Robert Wójcik, Founder & CEO Healthcare Innovation Embassy oraz Artur Mirończuk, Project Manager zajmujący się projekami AI w BlueSoft rozmawiają z dziennikarzem technologicznym, Pawłem Pilarczykiem na temat strategicznego i bezpiecznego wdrażania sztucznej inteligencji (AI) w medycynie. Read More
Posłuchaj podcastu
W dzisiejszym odcinku podcastu „Business Tech Talks powered by BlueSoft” Diana Kisiała, Data Protection Officer w BlueSoft omawia kluczowe zagrożenia i wyzwania związane ze zjawiskiem Shadow AI oraz bezpieczeństwem danych korporacyjnych w dobie powszechnego dostępu do sztucznej inteligencji. Koncentruje się na ryzyku wycieku poufnych informacji, odpowiedzialności zarządu za wdrożenie odpowiednich polityk oraz na praktycznych krokach, które pozwalają ucywilizować korzystanie z AI w firmie — od edukacji pracowników i klasyfikacji danych po wykorzystanie narzędzi typu DLP. Read More
Posłuchaj podcastu
W dzisiejszym odcinku podcastu „Business Tech Talks” gościmy Rafała Bilińskiego, Solutions Architecta w BlueSoft i autora niezwykłego projektu „MortAI Kombat”. Rafał przez kilka miesięcy testował wiodące modele AI, przeprowadzając setki testów w kilkudziesięciu różnych środowiskach, aby sprawdzić, który z nich najlepiej radzi sobie w realnych zadaniach biznesowych i technicznych. Read More
Posłuchaj podcastu
W dzisiejszym odcinku podcastu „Business Tech Talks powered by BlueSoft” zgłębiamy temat agentowej sztucznej inteligencji (Agentic AI), która jest określana jako kolejny wielki krok w rozwoju technologii po AI predykcyjnej i generatywnej. Skupiamy się na definicji sprawczości agentów, ich zdolności do samodzielnego podejmowania decyzji oraz różnicach między prostymi chatbotami a złożonymi systemami agentowymi. Read More
Posłuchaj podcastuDzięki BlueSoft zyskujesz dostęp do najnowszych technologii oraz wsparcia ekspertów, którzy chętnie dzielą się swoją wiedzą.