Méthodologie
Comment l'instantané a été construit, ce qui a été normalisé, ce qui a été exclu, et comment chaque chiffre est calculé.
Sources de données
La source du corpus. La génération des candidats a utilisé le point d'accès XHR public avec des requêtes G06N sur des fenêtres de publication de 3 jours (le point d'accès renvoie les 10 meilleurs candidats par pertinence et ignore la pagination : l'étendue vient de plus de 1 000 requêtes distinctes, pas des pages) ; chaque candidat a ensuite été vérifié en récupérant sa page détail, en ne gardant que les documents dont les classifications CPC listées incluent G06N. Les champs bibliographiques (titre, abrégé, déposant, inventeurs, dates, codes CPC) viennent des microdonnées de la page détail.
https://patents.google.com/L'émetteur officiel des brevets et demandes US du corpus. L'ancienne API de recherche sans clé (api.uspto.gov/patents/v1/search) a été retirée ; son remplacement exige une clé API vérifiée via ID.me, et les téléchargements en masse étaient injoignables depuis l'environnement de construction : la construction a donc utilisé Google Patents comme couche de récupération, substitution documentée ici plainement.
https://www.uspto.gov/Noté comme source de couverture mondiale pour les versions futures. Non utilisé à l'exécution car il faut un projet GCP avec facturation.
https://console.cloud.google.com/marketplace/product/google/patents-public-dataPérimètre et normalisation
- Classe CPC G06N uniquement (dispositions de calcul fondées sur des modèles de calcul spécifiques : la classe de l'apprentissage automatique).
- Dates de publication du 2025-10-01 au 2026-05-22 (instantané construit le 2026-10-09), échantillonnées par fenêtres de 3 jours pour une couverture temporelle uniforme.
- Documents conservés uniquement si la page détail liste au moins un code CPC commençant par G06N et un abrégé non vide. Les chiffres décrivent cet échantillon vérifié, pas l'univers complet des publications : la couche de récupération renvoie les meilleurs candidats par pertinence et ignore la pagination, donc les comptes mensuels montrent la composition de l'échantillon, pas les volumes réels de publication de l'USPTO.
- Le déposant est la chaîne assigneeOriginal de la notice ; les graphies d'inventeurs ne sont pas fusionnées.
- Dédupliqué par numéro de publication.
Comment chaque chiffre est calculé
- Dépôts par mois : compte des documents par mois de date de publication (composition de l'échantillon, pas recensement des publications).
- Principaux déposants : compte par chaîne déposant normalisée (minuscules, espaces rognés), top 15 affiché.
- Sous-groupes CPC : pour chaque document, ses sous-groupes G06N distincts (p. ex. G06N3/08) ; part = documents portant le sous-groupe / total des documents.
- Principaux inventeurs : compte par chaîne brute, top 15 affiché, variantes non fusionnées.
- Recherche sémantique : similarité cosinus entre le plongement de la requête et chaque plongement de document (titre + abrégé, text-embedding-3-large), top 20 renvoyé.
Ce qui a été exclu
- Le texte intégral des revendications : similarité et résumés n'utilisent que titres et abrégés.
- Le statut juridique au-delà de la publication : brevet délivré ou demande vient du code de nature du document, pas d'un statut en direct.
- Les notices non anglaises sont incluses avec leurs métadonnées anglaises Google Patents quand elles existent.