Dołączysz do zespołu rozwijającego platformę do przetwarzania i udostępniania danych niestrukturalnych, takich jak dokumenty, obrazy i nagrania audio. Budujemy rozwiązania wspierające wyszukiwanie semantyczne, RAG oraz narzędzia typu „chat with data”. Projekt dla banku PKO BP.
Forma współpracy: B2B
Opis stanowiska
budowa i rozwój pipeline’ów przetwarzania danych w trybie online i offline,
przetwarzanie dokumentów, obrazów i nagrań audio, w tym ekstrakcja tekstu i metadanych,
tworzenie usług oraz integracji API w Pythonie i/lub Rust,
indeksowanie danych i rozwój wyszukiwania semantycznego z wykorzystaniem Qdrant,
integracja z modelami embeddingowymi i rozwiązaniami GenAI,
wdrażanie, monitorowanie i utrzymywanie rozwiązań zgodnie z podejściem DevSecOps,
diagnozowanie incydentów oraz dbanie o jakość, wydajność i niezawodność procesów.
Wymagania
dobra znajomość Pythona i/lub Rusta,
doświadczenie w budowie pipeline’ów i usług przetwarzających dane,
praktyczna znajomość wektorowych baz danych, w szczególności Qdrant,
znajomość embeddingów, wyszukiwania semantycznego, filtrowania po metadanych i indeksowania,
doświadczenie z REST API, mile widziana znajomość FastAPI,
znajomość architektury sterowanej zdarzeniami, np. Kafka lub Pub/Sub,
dobra znajomość systemu Linux,
znajomość relacyjnych baz danych, np. PostgreSQL.
Mile widziane
doświadczenie z Kubernetes, Docker oraz CI/CD,
znajomość GCP, BigQuery, Dataflow, Dataproc lub Pub/Sub,
znajomość Apache Airflow, Spark lub Beam,
doświadczenie z OCR, transkrypcją audio oraz konwersją dokumentów,
znajomość baz grafowych, np. Neo4j,
doświadczenie z Knowledge Graph, GraphRAG lub klasycznymi rozwiązaniami RAG.
Nie oczekujemy znajomości wszystkich wymienionych technologii. Szukamy osoby z solidnymi podstawami inżynierii danych i gotowością do rozwoju w obszarze danych niestrukturalnych oraz AI.