Version améliorée de Jina AI ReaderLM-v2 : la qualité de conversion de HTML vers Markdown/JSON a été améliorée et la base de récupération d'agent a été mise à niveau.

Jina AI améliore la qualité de conversion HTML vers Markdown/JSON et étend les capacités de recherche dans Reader, et ReaderLM-v2 permet au contenu Web d'être entré dans LLM et Agent de manière plus fiable.

Version améliorée de Jina AI ReaderLM-v2 : la qualité de conversion de HTML vers Markdown/JSON a été améliorée et la base de récupération d'agent a été mise à niveau.

Jina AI a publié la version améliorée de ReaderLM-v2 en juin 2026. L'essentiel est d'améliorer la qualité de conversion HTML vers Markdown/JSON dans Reader à un niveau supérieur et de continuer à étendre les capacités liées à la recherche. En tant que base de récupération d'agent avec r.jina.ai et s.jina.ai comme noyau, cette mise à jour est directement liée à la fiabilité et à la fidélité du système RAG et de l'agent AI dans l'obtention d'informations sur les pages Web.

  • Amélioration de la qualité de conversion : ReaderLM-v2 améliore la précision de la conversion HTML vers Markdown/JSON, réduisant ainsi la perte d'informations et la confusion structurelle.
  • Extension des capacités de recherche : le point de terminaison de recherche continue d'être amélioré pour prendre en charge l'acquisition d'informations en temps réel par l'agent.
  • Base de récupération composée : Reader, Embeddings, Reranker, DeepSearch et d'autres fonctionnalités peuvent être appelées indépendamment et librement combinées.
  • Pour une sortie compatible LLM : la conversion du contenu d'une page Web en texte compatible LLM est une couche de prétraitement clé pour RAG et Agent.

Arrière-plan de la version

Jina AI ne se positionne pas comme une autre base de données vectorielle ou un moteur de recherche, mais comme un ensemble de couches d'infrastructure de recherche open source avec la « récupération par composants » comme concept principal. Il décompose la lecture de pages Web (Reader), la vectorisation sémantique (Embeddings), le réarrangement de pertinence (Reranker), la compréhension multimodale et le raisonnement de recherche approfondie (DeepSearch) en modules API qui peuvent être appelés indépendamment et librement combinés. L'API Reader a continué d'évoluer depuis 2023-01, lorsqu'elle a exposé les capacités de lecture d'URL r.jina.ai, et ReaderLM-v2 est une mise à niveau clé de la qualité de conversion dans cette évolution.

Points forts de cette version

Amélioration de la conversion ReaderLM-v2

  • HTML vers Markdown : restaurez la structure de la page Web avec plus de précision, supprimez les bruits tels que la navigation et les publicités, et conservez la sémantique du texte.
  • HTML vers JSON : Extraction structurée des informations de la page pour faciliter la consommation programmatique et le stockage des données.
  • Amélioration de la fidélité : les structures complexes telles que les tables, les blocs de code et les listes sont moins déformées lors de la conversion, réduisant ainsi les coûts d'analyse en aval.

Composants de recherche et de récupération

  • s.jina.ai Search : capacité de recherche en temps réel orientée agent, travaillant avec Reader pour compléter la boucle fermée « recherche-lecture ».
  • Embeddings et Reranker : Vectorisation sémantique et réarrangement de la pertinence pour améliorer la qualité de la récupération.
  • DeepSearch : capacités de raisonnement de recherche approfondie, prenant en charge des scénarios de récupération en plusieurs étapes.

Signification pour les développeurs

D'un point de vue industriel, la mise à niveau ReaderLM-v2 de Jina AI souligne les exigences déterministes de l'infrastructure de l'agent : les informations sur les pages Web sont l'une des sources de données externes les plus importantes pour l'agent, et la qualité de la conversion des « pages Web en texte structuré » détermine directement la qualité de réponse des applications RAG. Pour les développeurs nationaux, cela signifie que lors de la création d'applications de questions et réponses de documents, d'agrégation d'informations et d'agents, ils peuvent d'abord connecter une « lecture fiable de pages Web » en tant qu'infrastructure, puis ajouter une vectorisation et un réarrangement.

Pour les équipes qui créent des applications de structure RAG telles que LlamaIndex, Reader fournit une implémentation de haute qualité du "chargeur de pages Web", qui peut réduire considérablement la charge de travail d'exploration et de nettoyage auto-construits.

Conseils pour commencer

  • Application RAG : utilisez le point de terminaison Reader pour remplacer l'analyse de page Web auto-construite afin de vérifier l'amélioration de la précision des réponses grâce à la qualité de la conversion.
  • Développement d'agent : combinez la recherche s.jina.ai et Reader pour créer un lien d'informations sur l'agent de "recherche en temps réel - lecture de page Web - sortie structurée".
  • Critères d'évaluation : La qualité de la base est mesurée en deux dimensions : "précision de la conversion structurée" et "pertinence des résultats de recherche".

Orientations dignes d'attention à l'avenir

  1. Limite de qualité de conversion : performances de conversion de pages dynamiques complexes, de pages anti-crawl et de contenu multilingue.
  2. Performances en temps réel des capacités de recherche : la couverture des performances en temps réel et des différences régionales affecte la portée de la mise en œuvre de l'agent.
  3. Comparaison avec les composants de récupération domestique : comparaison des mesures réelles avec les solutions de récupération domestique dans les pages Web chinoises et les scénarios de recherche chinois.
Copyright : Contenu source Sortie officielle de Jina AI . Cette plateforme a compilé et organisé ce contenu à des fins d'information et d'échange éducatif. Pour tout problème de droit d'auteur, veuillez nous contacter.

Avis

  • Chargement des avis...