Dołączysz do zespołu rozwijającego platformę do przetwarzania i udostępniania danych niestrukturalnych, takich jak dokumenty, obrazy i nagrania audio. Budujemy rozwiązania wspierające wyszukiwanie semantyczne, RAG oraz narzędzia typu „chat with data”. Projekt dla banku PKO BP.

Forma współpracy: B2B

Opis stanowiska

  • budowa i rozwój pipeline’ów przetwarzania danych w trybie online i offline,

  • przetwarzanie dokumentów, obrazów i nagrań audio, w tym ekstrakcja tekstu i metadanych,

  • tworzenie usług oraz integracji API w Pythonie i/lub Rust,

  • indeksowanie danych i rozwój wyszukiwania semantycznego z wykorzystaniem Qdrant,

  • integracja z modelami embeddingowymi i rozwiązaniami GenAI,

  • wdrażanie, monitorowanie i utrzymywanie rozwiązań zgodnie z podejściem DevSecOps,

  • diagnozowanie incydentów oraz dbanie o jakość, wydajność i niezawodność procesów.

Wymagania

  • dobra znajomość Pythona i/lub Rusta,

  • doświadczenie w budowie pipeline’ów i usług przetwarzających dane,

  • praktyczna znajomość wektorowych baz danych, w szczególności Qdrant,

  • znajomość embeddingów, wyszukiwania semantycznego, filtrowania po metadanych i indeksowania,

  • doświadczenie z REST API, mile widziana znajomość FastAPI,

  • znajomość architektury sterowanej zdarzeniami, np. Kafka lub Pub/Sub,

  • dobra znajomość systemu Linux,

  • znajomość relacyjnych baz danych, np. PostgreSQL.

Mile widziane

  • doświadczenie z Kubernetes, Docker oraz CI/CD,

  • znajomość GCP, BigQuery, Dataflow, Dataproc lub Pub/Sub,

  • znajomość Apache Airflow, Spark lub Beam,

  • doświadczenie z OCR, transkrypcją audio oraz konwersją dokumentów,

  • znajomość baz grafowych, np. Neo4j,

  • doświadczenie z Knowledge Graph, GraphRAG lub klasycznymi rozwiązaniami RAG.

Nie oczekujemy znajomości wszystkich wymienionych technologii. Szukamy osoby z solidnymi podstawami inżynierii danych i gotowością do rozwoju w obszarze danych niestrukturalnych oraz AI.