Pile
Ce que fait GlowLens
GlowLens prend des images et les transforme en signaux structures: ce qui est sur l'image, des attributs mesurables et un score de confiance pour chaque reponse. Ca a commence comme une experience sur la distance parcourue par les modeles de vision modernes, et c'est devenu un bloc reutilisable vers lequel je me tourne des qu'un projet doit comprendre une image.
La confiance fait partie de la reponse
La decision de conception la plus importante a ete que GlowLens ne donne jamais juste un resultat, mais un resultat plus son degre de certitude. Un modele de vision qui donne une reponse fausse avec assurance est dangereux; un qui dit "probablement ceci, mais je ne suis sur qu'a 60 pour cent" laisse le systeme autour prendre une decision intelligente.
- Chaque attribut extrait vient avec un signal de confiance, pas juste une valeur.
- Les resultats a faible confiance sont routes vers un humain plutot que crus aveuglement.
- L'output est du JSON structure, pour que l'etape suivante de la pipeline puisse bifurquer selon la confiance.
La ou les modeles de vision trebuchent encore
La vision est vraiment impressionnante aujourd'hui, mais ce n'est pas de la magie. Elle peine avec les angles inhabituels, la mauvaise lumiere et tout ce qu'elle a rarement vu, et surtout elle echoue d'une facon qui a l'air assuree. La lecon que j'ai retenue est que la valeur d'un outil de vision n'est pas seulement sa precision dans les cas faciles, mais avec quelle elegance il traite les cas difficiles. En faisant de la confiance un output de premiere classe et en routant les cas incertains vers un humain, GlowLens est devenu quelque chose sur quoi je pouvais reellement construire, plutot qu'une demo astucieuse qui vous ment discretement sous pression.
Leçons apprises
- Faites de la confiance un output de premiere classe. Un resultat sans signal de confiance cache son propre risque.
- Routez les cas a faible confiance vers un humain, plutot que de faire aveuglement confiance au modele.
- Du JSON structure laisse l'etape suivante bifurquer selon l'incertitude. Le texte libre non.
- Les modeles de vision echouent avec assurance. Concevez pour les cas difficiles, pas pour les cas faciles adaptes a la demo.
