Abstract :
[en] Animal health is a key challenge for sustainable dairy farming, impacting productivity, profitability, drug use, and societal views on livestock production. Monitoring animal health on a large scale is difficult due to costly, heterogeneous, and often unavailable clinical diagnoses. Meanwhile, Fourier-transform mid-infrared (FT-MIR) spectrometry is globally used in milk recording and payment systems, producing extensive spectral data that can provide insights into animal physiology, metabolism, and herd management.
This thesis aimed to explore new methodologies for processing large-scale milk FT-MIR databases to develop data-driven monitoring tools for dairy farming. Specifically, it investigated unsupervised learning approaches to identify recurrent clusters in milk data. Unlike conventional supervised methods relying on predefined diagnoses or reference values, this methodology aimed to exploit the data's intrinsic structure to generate new hypotheses and monitoring indicators. Two main applications were developed: a cow-level approach using Holstein milk data and a herd-level approach based on bulk tank milk analyses. Clustering methodologies applied to FT-MIR-derived variables enabled the identification of distinct patterns related to management practices, metabolism disorders, and udder health.
Beyond methodology, this thesis emphasizes that validating unsupervised monitoring systems requires more than methodological performance. A multilayered validation framework was proposed, structured around five dimensions: cluster stability, transferability, predictability, biological validity, and practical utility. Stability refers to reproducibility across repeated analyses, while transferability evaluates robustness across populations, lactations, regions, or systems. Predictability assesses the capacity to predict new observations from different contexts, and biological validity examines whether clusters correspond to meaningful physiological or management-related phenomena. Practical utility considers operational feasibility in field conditions and return on investment.
The final validation phase involves on-farm deployment, incorporating a feedback loop where farmers and veterinarians verify system-generated alerts. This real-time validation would enable continuous model refinement through reinforcement learning, enhancing system adaptability and accuracy over time. Successful implementation requires robust data and computational infrastructure for rapid processing and alert dissemination. By integrating these concepts, this thesis promotes the development of precision dairy farming alert systems that are both scientifically rigorous and operationally effective. Overall, the thesis demonstrates the potential of combining FT-MIR spectrometry, big data, and unsupervised learning to develop scalable and interpretable monitoring tools for precision dairy farming.
[fr] La santé animale constitue un enjeu majeur pour la durabilité des élevages laitiers, avec des répercussions sur la productivité, la rentabilité, l’utilisation des médicaments et la perception sociétale de la production animale. Le suivi de la santé animale à grande échelle demeure difficile en raison du coût, de l’hétérogénéité et de la fréquence des diagnostics cliniques. Pourtant, la spectrométrie moyen infrarouge à transformée de Fourier (FT-MIR), largement utilisée pour le contrôle laitier et le paiement du lait, génère d’importantes quantités de données spectrales fournissant des informations sur la physiologie animale, le métabolisme et la gestion des troupeaux.
Cette thèse a pour objectif d’explorer de nouvelles méthodologies de traitement des spectres FT-MIR du lait à grande échelle afin de développer des outils de suivi pour l’élevage laitier. Elle s’est intéressée à des approches d’apprentissage non supervisé visant à identifier des clusters au sein des données spectrales. Contrairement aux méthodes supervisées conventionnelles reposant sur des diagnostics prédéfinis ou des valeurs de référence, cette approche exploite la structure intrinsèque des données afin de générer de nouvelles hypothèses et de nouveaux indicateurs de suivi. Deux applications principales ont été développées : une approche à l’échelle de la vache utilisant des données de lait individuel et une approche à l’échelle du troupeau basée sur le lait de tank. Ces clustering ont permis d’identifier des profils associés aux pratiques de gestion, aux désordres métaboliques et à la santé du pis.
Au-delà des aspects méthodologiques, cette thèse souligne que la validation des systèmes de suivi non supervisés nécessite davantage qu’une simple évaluation de la performance statistique. Une approche de validation multicouche a été proposée autour de cinq dimensions : la stabilité des clusters, la transférabilité, la prédictibilité, la validité biologique et l’utilité pratique. La stabilité fait référence à la reproductibilité des résultats, tandis que la transférabilité évalue leur persistance entre populations, lactations, régions ou systèmes. La prédictibilité mesure la capacité à classer de nouvelles observations, et la validité biologique examine si les clusters correspondent à des phénomènes physiologiques ou de gestion pertinents. Enfin, l’utilité pratique concerne l'utilité et la faisabilité opérationnelle en conditions de terrain.
La phase finale de validation implique le déploiement du système sur site, en intégrant une boucle de rétroaction grâce aux retours des éleveurs et des vétérinaires qui vérifient les alertes générées. Ceci nécessite cependant une infrastructure informatique robuste permettant un traitement rapide des données et une diffusion efficace des alertes. Cette validation en temps réel permettrait une amélioration continue des modèles via l’apprentissage par renforcement. En conclusion, cette thèse démontre le potentiel de la combinaison de la spectrométrie FT-MIR, du big data et de l’apprentissage non supervisé pour développer des outils de suivi destinés à l’élevage laitier de précision.