Dołączysz do zespołu rozwijającego rozwiązanie „chat with data”, które umożliwia użytkownikom zadawanie pytań o dane w języku naturalnym. Będziesz pracować nad interpretacją intencji, generowaniem i bezpiecznym wykonywaniem zapytań oraz oceną jakości odpowiedzi.

Będziesz również wspierać rozwój Unstructured Data Repository (UDR), czyli platformy do przetwarzania, przechowywania i udostępniania danych niestrukturalnych, takich jak dokumenty, obrazy i nagrania audio, wykorzystywanych następnie przez rozwiązania AI.

Forma współpracy: B2B

Opis stanowiska

  • projektowanie i rozwój rozwiązania „chat with data”, w szczególności mechanizmów NL2SQL i conversational analytics,

  • budowa usług wykorzystujących LLM oraz integracja modeli z danymi i systemami firmowymi,

  • tworzenie zabezpieczeń ograniczających halucynacje, błędne zapytania i nieuprawniony dostęp do danych,

  • rozwój rozwiązań RAG, obejmujących chunking, embeddingi, wyszukiwanie semantyczne i re-ranking,

  • projektowanie testów i ewaluacji jakości rozwiązań GenAI,

  • optymalizacja jakości, wydajności i kosztów zapytań BigQuery,

  • tworzenie usług i integracji API w Javie i/lub Pythonie,

  • wsparcie UDR w zakresie przetwarzania dokumentów, obrazów i nagrań audio, ekstrakcji treści i metadanych oraz udostępniania wyników rozwiązaniom AI,

  • integracja modeli AI z procesami przetwarzania danych niestrukturalnych,

  • wdrażanie, monitorowanie i utrzymywanie rozwiązań zgodnie z podejściem DevSecOps.

Wymagania

  • bardzo dobra znajomość Javy i/lub Pythona,

  • praktyczne doświadczenie w budowie rozwiązań wykorzystujących LLM,

  • znajomość co najmniej jednego frameworka, np. LangChain4j, Google ADK, Pydantic AI lub Spring AI,

  • znajomość Google BigQuery, w tym SQL, modelowania danych oraz optymalizacji kosztów i wydajności,

  • doświadczenie w tworzeniu usług i integracji REST API,

  • umiejętność testowania i diagnozowania systemów opartych na LLM,

  • znajomość dobrych praktyk tworzenia, wdrażania i utrzymywania oprogramowania.

Mile widziane

  • doświadczenie z NL2SQL, conversational analytics lub rozwiązaniami BI-as-chat,

  • znajomość RAG, embeddingów, chunkingu i re-rankingu,

  • doświadczenie w przetwarzaniu dokumentów, obrazów lub nagrań audio, w tym OCR, ekstrakcji tekstu i transkrypcji,

  • doświadczenie z ewaluacją systemów GenAI, testami offline i online oraz wersjonowaniem promptów,

  • znajomość semantic lub metrics layer, cache’owania i preagregacji,

  • znajomość MCP oraz architektur agentowych,

  • doświadczenie z bazami wektorowymi, np. Qdrant, Pinecone, Weaviate lub Milvus,

  • znajomość baz grafowych, np. Neo4j, oraz podejścia GraphRAG,

  • znajomość FastAPI, Kubernetes, Cloud Run i Pub/Sub,

  • znajomość Rusta,

  • doświadczenie w środowisku regulowanym, obejmującym audyt, klasyfikację danych, kontrolę dostępu i ochronę danych wrażliwych.

Nie oczekujemy znajomości wszystkich wymienionych technologii. Szukamy osoby z solidnymi podstawami inżynierii oprogramowania i praktycznym doświadczeniem w pracy z LLM, gotowej rozwijać się w obszarze „chat with data”, danych niestrukturalnych oraz AI.