MobileNet, un réseau de neurones, a été entraîné sur plus d'un million de photos (ImageNet). Pour chaque image, il produit une empreinte de 1280 nombres qui résume formes, textures et couleurs.
Le son est découpé en tranches de 16 ms. Pour chacune, l'IA mesure l'énergie dans 32 bandes de fréquence, comme l'oreille, puis en tire 16 mesures du timbre. La moyenne et la variation sur 0,8 seconde forment l'empreinte d'une voix.
Face à une nouvelle image ou un nouveau son, l'IA cherche les exemples les plus proches, et ils votent. Le pourcentage est la part des votes, pas une certitude.
Elle choisit toujours parmi tes classes. Si tes exemples sont biaisés (même fond, même pièce), elle le sera aussi.
Le modèle est inclus dans le site. Aucune image ni aucun son ne quitte l'appareil, même sans internet.
Entraîne « pomme » seulement sur fond blanc, puis teste sur fond rouge. En audio, enregistre ta voix calme puis teste en criant.
Dans le rayon Comprendre : un film animé sur l'IA et le voyage d'une image ou d'un son dans Œil Malin. Active aussi Vision IA sous la caméra.