Investigating the Failure Modes of the AUC metric and Exploring Alternatives for Evaluating Systems in Safety Critical Applications

Mots clés générés par l'IA : AUC sécurité réponse sélective modèles pré-entraînés limites

Points clés générés par l'IA

La licence de l'article ne nous permet pas de nous appuyer sur son contenu et les points clés sont générés à l'aide des métadonnées de l'article plutôt que de l'article complet.

  • L'évaluation de la capacité de réponse sélective des modèles de boîte noire est critique pour les exigences de sécurité.
  • L'aire sous la courbe (AUC) est utilisée comme métrique, mais elle présente des limites.
  • Les auteurs ont proposé trois métriques alternatives pour corriger les limitations identifiées dans l'AUC.
  • En expérimentant avec dix modèles, leurs résultats montrent que les modèles pré-entraînés plus récents et plus grands ne montrent pas nécessairement de meilleures performances en matière de réponse sélective.
  • Ces insights fourniront des informations précieuses pour le développement de modèles mieux adaptés aux applications critiques en matière de sécurité.
Accédez également à nos autres résultats générés par IA : Résumé complet, Résumé vulgarisé, Article de type blog; ou posez des questions sur cet article à notre Assistant IA.

Auteurs : Swaroop Mishra, Anjana Arunkumar, Chitta Baral

Résumé : With the increasing importance of safety requirements associated with the use of black box models, evaluation of selective answering capability of models has been critical. Area under the curve (AUC) is used as a metric for this purpose. We find limitations in AUC; e.g., a model having higher AUC is not always better in performing selective answering. We propose three alternate metrics that fix the identified limitations. On experimenting with ten models, our results using the new metrics show that newer and larger pre-trained models do not necessarily show better performance in selective answering. We hope our insights will help develop better models tailored for safety-critical applications.

Soumis à arXiv le 10 Oct. 2022

Posez des questions sur cet article à notre assistant IA

Vous pouvez aussi discutez avec plusieurs papiers à la fois ici.

La licence de l'article ne nous permet pas de nous appuyer sur son contenu et l'assistant IA ne peut se servir que des métadonnées de l'article plutôt que de l'article complet.

Instructions pour utiliser l'assistant IA ?

Résultats du processus de synthèse de l'article arXiv : 2210.04466v1

La licence de cet article ne nous permet pas de nous appuyer sur son contenu et le processus de synthèse est ici effectué avec les métadonnées de l'article plutôt qu'avec l'article en tant que tel.

Avec l'importance croissante des exigences de sécurité associées à l'utilisation de modèles de boîte noire, l'évaluation de la capacité de réponse sélective des modèles est critique. L'aire sous la courbe (AUC) est utilisée comme métrique à cette fin. Cependant, nous avons constaté des limites dans l'AUC ; par exemple, un modèle ayant une AUC plus élevée n'est pas toujours meilleur pour effectuer une réponse sélective. Pour corriger les limitations identifiées, les auteurs Swaroop Mishra, Anjana Arunkumar et Chitta Baral ont proposé trois métriques alternatives dans leur article intitulé "Investigating the Failure Modes of the AUC metric and Exploring Alternatives for Evaluating Systems in Safety Critical Applications". En expérimentant avec dix modèles, leurs résultats montrent que les modèles pré-entraînés plus récents et plus grands ne montrent pas nécessairement de meilleures performances en matière de réponse sélective. Ces insights fourniront des informations précieuses pour le développement de modèles mieux adaptés aux applications critiques en matière de sécurité.
Créé le 27 Jui. 2023

Évaluez la qualité du contenu généré par l'IA en votant

Note : 0

Pourquoi avons-nous besoin de votes ?

Les votes sont utilisés pour déterminer si nous devons réexécuter nos outils de synthèse. Si le compte atteint -10, nos outils peuvent être redémarrés.

Le résumé précédent a été créé il y a plus d'un an et peut être réexécuté (si nécessaire) en cliquant sur le bouton Exécuter ci-dessous.

La licence de cet article spécifique ne nous permet pas de nous appuyer sur son contenu et les outils de synthèse seront exécutés en utilisant les métadonnées de l'article plutôt que l'article complet. Cependant, l'outil produira quand même un bon résultat, et vous pouvez également essayer nos outils sur des papiers avec des licences plus ouvertes.

Articles similaires résumés avec nos outils d'IA

Naviguez à travers encore plus d'articles similaires en utilisant une

représentation arborescente

Recherchez des articles similaires (en version bêta)

En cliquant sur le bouton ci-dessus, notre algorithme analysera tous les articles de notre base de données pour trouver le plus proche en fonction du contenu des articles complets et pas seulement des métadonnées. Veuillez noter que cela ne fonctionne que pour les articles pour lesquels nous avons généré des résumés et que vous pouvez le réexécuter de temps en temps pour obtenir un résultat plus précis pendant que notre base de données s'agrandit.

Avertissement : Notre outil de synthèse basé sur l'IA et l'assistant virtuel fournis sur ce site Web peuvent ne pas toujours fournir des résumés complets ou des réponses exactes. Nous vous encourageons à examiner attentivement et à évaluer le contenu généré pour vous assurer de sa qualité et de sa pertinence par rapport à vos besoins.