STAGE Ingénieur Développement de pipeline IA de startups (F/H)
- Référence: 549365_1788771573
- Date de dépot: 07/09/2026
- Entreprise: DASSAULT SYSTEMES
- Site Internet DASSAULT SYSTEMES
Description
Dassault Systèmes, entreprise scientifique de 25 000 collaborateurs, accompagne 370 000 clients dans 184 pays dans des secteurs clés : industrie, infrastructures, villes, santé. Nous collaborons avec des partenaires stratégiques (FDA, Harvard, MIT, INRIA, INSERM), des Prix Nobel et des acteurs majeurs pour repousser les limites de la technologie.
La veille sur les startups est un enjeu stratégique pour identifier des opportunités de partenariats, d'acquisitions ou d'innovation. Les bases de données existantes (ex. OpenCorporates) sont incomplètes ou obsolètes, tandis que le web (sites, communiqués, réseaux sociaux, brevets) regorge de données inexploitées.
L'objectif du stage :
Concevoir et prototyper un pipeline intelligent pour :
Extraire et enrichir les données startups (identité, technologies, levées de fonds, brevets, etc.).
Structurer ces données dans un schéma exploitable.
Évaluer leur pertinence via des méthodes de scoring (adéquation avec nos activités, potentiel, maturité).
Pourquoi ce stage ?
Impact direct : Contribuer à la stratégie d'innovation de Dassault Systèmes.
Technologies de pointe : IA, LLM, traitement de données massives.
Environnement stimulant : Collaboration avec des experts et accès à des ressources uniques.
Vos missions
Plus concrètement, vos activités se concentreront sur :
1. Modélisation des données :
Définir les informations à extraire (activité, technologies, équipe, levées de fonds, brevets, etc.).
Analyser les lacunes des bases existantes.
2️. Exploitation des bases de données :
Comparer les sources disponibles (couverture, fraîcheur, API).
Automatiser l'ingestion et la normalisation des données.
3️. Enrichissement automatisé par IA :
Développer un pipeline de collecte et d'extraction d'informations via des LLM (sites web, réseaux professionnels, publications).
Intégrer ces données dans le schéma défini (entity matching / déduplication entre sources).
Définir une représentation vectorielle de ces indicateurs en utilisant un modèle d'embedding (à choisir après un benchmark).
4️. Scoring et qualification :
Proposer des méthodes pour classer et prioriser les startups en fonction de leur adéquation avec nos enjeux.
Développer un pipeline de clustering pour définir des catégories de startups par domaine.
5. Démonstrateur :
Développer une interface ou tableau de bord permettant d'explorer les startups d'un domaine donné, leurs fiches enrichies et leur score.
La veille sur les startups est un enjeu stratégique pour identifier des opportunités de partenariats, d'acquisitions ou d'innovation. Les bases de données existantes (ex. OpenCorporates) sont incomplètes ou obsolètes, tandis que le web (sites, communiqués, réseaux sociaux, brevets) regorge de données inexploitées.
L'objectif du stage :
Concevoir et prototyper un pipeline intelligent pour :
Extraire et enrichir les données startups (identité, technologies, levées de fonds, brevets, etc.).
Structurer ces données dans un schéma exploitable.
Évaluer leur pertinence via des méthodes de scoring (adéquation avec nos activités, potentiel, maturité).
Pourquoi ce stage ?
Impact direct : Contribuer à la stratégie d'innovation de Dassault Systèmes.
Technologies de pointe : IA, LLM, traitement de données massives.
Environnement stimulant : Collaboration avec des experts et accès à des ressources uniques.
Vos missions
Plus concrètement, vos activités se concentreront sur :
1. Modélisation des données :
Définir les informations à extraire (activité, technologies, équipe, levées de fonds, brevets, etc.).
Analyser les lacunes des bases existantes.
2️. Exploitation des bases de données :
Comparer les sources disponibles (couverture, fraîcheur, API).
Automatiser l'ingestion et la normalisation des données.
3️. Enrichissement automatisé par IA :
Développer un pipeline de collecte et d'extraction d'informations via des LLM (sites web, réseaux professionnels, publications).
Intégrer ces données dans le schéma défini (entity matching / déduplication entre sources).
Définir une représentation vectorielle de ces indicateurs en utilisant un modèle d'embedding (à choisir après un benchmark).
4️. Scoring et qualification :
Proposer des méthodes pour classer et prioriser les startups en fonction de leur adéquation avec nos enjeux.
Développer un pipeline de clustering pour définir des catégories de startups par domaine.
5. Démonstrateur :
Développer une interface ou tableau de bord permettant d'explorer les startups d'un domaine donné, leurs fiches enrichies et leur score.
Profil recherché
Votre Profil
Vous êtes actuellement en Master 2 / Bac+5 (école d'ingénieur ou université) avec une spécialisation en Data Science & Machine Learning.
Curieux(se), rigoureux(se), vous avez un sens aigu de la synthèse et de la structuration des données scientifiques, avec un intérêt marqué pour leur valorisation.
Compétences techniques obligatoires :
*
Python (maîtrise impérative) + écosystème data : pandas, scikit-learn
*
NLP : embeddings, similarité sémantique, tokenisation
*
LLM (BERT, Qwen, etc.) : prompting, sorties structurées
*
Apprentissage non supervisé : clustering, réduction de dimension (UMAP, t-SNE)
*
Anglais courant (écrit & oral) + excellentes qualités rédactionnelles (FR/EN) pour la formalisation méthodologique
Vous êtes fait(e) pour ce stage si vous alliez rigueur technique et envie d'innover dans la valorisation des données.
Nous rejoindre c'est aussi
Intégrer une entreprise scientifique au cœur de l'innovation technologique, portée par une forte croissance depuis plus de 40 ans.
Un environnement collaboratif et innovant
Une collaboration internationale
Une diversité de technologies, produits et solutions
Un engagement fort en faveur de la diversité et de l'inclusion
Vous êtes actuellement en Master 2 / Bac+5 (école d'ingénieur ou université) avec une spécialisation en Data Science & Machine Learning.
Curieux(se), rigoureux(se), vous avez un sens aigu de la synthèse et de la structuration des données scientifiques, avec un intérêt marqué pour leur valorisation.
Compétences techniques obligatoires :
*
Python (maîtrise impérative) + écosystème data : pandas, scikit-learn
*
NLP : embeddings, similarité sémantique, tokenisation
*
LLM (BERT, Qwen, etc.) : prompting, sorties structurées
*
Apprentissage non supervisé : clustering, réduction de dimension (UMAP, t-SNE)
*
Anglais courant (écrit & oral) + excellentes qualités rédactionnelles (FR/EN) pour la formalisation méthodologique
Vous êtes fait(e) pour ce stage si vous alliez rigueur technique et envie d'innover dans la valorisation des données.
Nous rejoindre c'est aussi
Intégrer une entreprise scientifique au cœur de l'innovation technologique, portée par une forte croissance depuis plus de 40 ans.
Un environnement collaboratif et innovant
Une collaboration internationale
Une diversité de technologies, produits et solutions
Un engagement fort en faveur de la diversité et de l'inclusion
Informations complémentaires
| Contrat | : | Stage |
|---|---|---|
| Lieu de la mission | : | Yvelines Vélizy-villacoublay |
| Niveau d'étude | : | Bac + 5 et plus : DEA, DESS, mastère, MBA... |
| Poste(s) disponible(s) | : | 1 |
| Poste de cadre | : | Suivant Profil |
| Début de la mission | : | Dès que possible |
| Secteur | : | Direction |
Postée par DASSAULT SYSTEMES le 07/09/2026
Découvrez DASSAULT SYSTEMES
Dassault Systèmes contribue à améliorer la vie réelle grâce aux mondes virtuels.
Grâce à nos solutions scientifiques, nous offrons des expériences de jumeaux virtuels à tous, y compris à vous ! Nous sommes fiers d'être une entreprise durable qui aide les particuliers et les entreprises à donner vie à de nouvelles idées de manière durable.
Nous sommes un catalyseur de progrès humains durables et révolutionnaires.
Notre aventure a débuté en 1981 avec 20 ingénieurs au service de l' industrie aéronautique à travers une seule marque : CATIA . Aujourd'hui, plus de 23 800 collaborateurs sont animés par une passion commune : prouver comment le monde virtuel peut améliorer la vie réelle.
Nous ne sommes pas seulement une société de logiciels. Nous sommes un fournisseur de solutions scientifiques et technologiques qui se concentre sur l'amélioration de l'expérience humaine. Nos 13 marques proposent des services de conception 3D, de maquette numérique (DMU), de gestion du cycle de vie des produits (PLM) et bien plus encore pour accompagner les acteurs du monde entier dans le développement de nouvelles approches en matière de logistique verte, de durabilité des produits, de réduction des déchets et bien plus encore.
Depuis 2020, nous avons étendu notre impact dans le secteur des sciences de la vie et de la santé avec des expériences de jumeaux virtuels du corps humain basées sur la science pour aider nos clients à améliorer les décisions médicales et à améliorer le parcours des patients.
Grâce à nos solutions scientifiques, nous offrons des expériences de jumeaux virtuels à tous, y compris à vous ! Nous sommes fiers d'être une entreprise durable qui aide les particuliers et les entreprises à donner vie à de nouvelles idées de manière durable.
Nous sommes un catalyseur de progrès humains durables et révolutionnaires.
Notre aventure a débuté en 1981 avec 20 ingénieurs au service de l' industrie aéronautique à travers une seule marque : CATIA . Aujourd'hui, plus de 23 800 collaborateurs sont animés par une passion commune : prouver comment le monde virtuel peut améliorer la vie réelle.
Nous ne sommes pas seulement une société de logiciels. Nous sommes un fournisseur de solutions scientifiques et technologiques qui se concentre sur l'amélioration de l'expérience humaine. Nos 13 marques proposent des services de conception 3D, de maquette numérique (DMU), de gestion du cycle de vie des produits (PLM) et bien plus encore pour accompagner les acteurs du monde entier dans le développement de nouvelles approches en matière de logistique verte, de durabilité des produits, de réduction des déchets et bien plus encore.
Depuis 2020, nous avons étendu notre impact dans le secteur des sciences de la vie et de la santé avec des expériences de jumeaux virtuels du corps humain basées sur la science pour aider nos clients à améliorer les décisions médicales et à améliorer le parcours des patients.
Diagnostic d'accessibilité
Nouveau : obtenez une estimation rapide de compatibilité.
Evaluez la compatibilité de cette offre avec vos contraintes.
Partager cette offre
Si cette annonce ne vous correspond pas ?
Pensez à vos amis en leur partageant le lien.