Réponse en bref
Un jeu de données peut produire mille pages d'atterrissage en une semaine. Qu'il s'agisse d'un millier de pages ou d'une page répétée un millier de fois est décidé dans le tableur, bien avant que le modèle ne tourne.
Une ligne est une promesse que la page doit tenir
Le catalogue présente ce travail comme un référencement programmatique : des centaines de pages d'atterrissage d'un seul tableau, classées dans la catégorie Génération de pages, coûtées de 500 $ à 2 500 $, et portant une cote de difficulté, le catalogue n'adoucit pas – coûteux et complexe. La description indique le mécanisme sans cérémonie: d'un seul jeu de données viennent des centaines ou des milliers de pages d'atterrissage destinées à des requêtes à basse fréquence en forme de service plus ville ou produit plus paramètre. Tout ce qui est vraiment dur dans le projet est compressé dans le jeu de données de mot.
Le modèle est la partie la moins intéressante du système, ce qui explique exactement pourquoi tant de constructions échouent là. Un modèle est une phrase fixe avec des trous dedans, et les trous remplis d'une colonne de noms de ville produisent une phrase fixe répétée plusieurs centaines de fois. Un visiteur qui atterrit sur la douzième de ces pages ne lit pas une nouvelle page. Ils lisent la même page avec un nom différent dans le titre, et un moteur de recherche l'évalue précisément à ces termes.
Donc la question utile est jamais combien de pages un tableau peut produire. C'est à quel point n'importe quelle rangée sait qu'aucune autre rangée ne sait. Si la ligne pour Manchester et la ligne pour Leeds diffèrent uniquement par le mot dans le titre, le tableau contient une page, pas deux. S'ils diffèrent par le prix, la disponibilité, la fenêtre de livraison, la réglementation locale, le nom du fournisseur et une photographie prise dans cette ville, le tableau contient deux pages et a probablement de la place pour plusieurs autres.
C'est la couture du projet entier. Distribution signifie prendre la variation qui existe réellement dans une entreprise et donner à chaque variante une adresse stable qu'un moteur de recherche peut atteindre et un acheteur peut signet. La duplication signifie la fabrication d'adresses pour la variation qui n'existe nulle part sauf dans la boucle qui les a générées. À l'intérieur d'un pipeline de construction, les deux sont indissociables. Ils divergent seulement dans ce que contient la ligne, ce qui en fait un problème de données bien avant qu'il ne devienne une publication.
L'abus de contenu à l'échelle est un jugement sur la valeur, pas sur les machines
Les moteurs de recherche ont donné à ce mode d'échec un nom — abus de contenu à l'échelle — et la définition récompense la lecture attentive surtout pour ce qu'il laisse de côté. Il ne dit pas généré. Il ne dit pas automatisé, modélisé, traduit ou écrit par un modèle. Il décrit les pages produites en quantité qui offrent peu de valeur à la personne qui arrive sur eux, et il considère la méthode de production comme sans rapport avec le verdict qui suit.
Ce cadrage est inopportun pour quiconque espère une exemption technique et libérateur tranquillement pour quiconque construit soigneusement. Une page manuscrite avec rien dans elle se trouve dans la même catégorie qu'une page manuscrite avec rien dedans. Une page assemblée par machine avec des niveaux de stock réels, des prix réels, une disponibilité réelle et une photographie réelle ne se situe pas du tout dans cette catégorie, et aucune information sur la façon dont elle a été assemblée ne la déplace de toute façon.
La conséquence pratique est que le travail de conformité se produit dans la feuille de calcul plutôt que dans la prose. Vous ne pouvez pas écrire votre sortie d'une rangée vide; vous ne pouvez que refuser de la publier. Chaque build programmatique sérieux contient donc un composant que les constructions occasionnelles omettent entièrement : une porte qui décide, par ligne, si cet enregistrement contient suffisamment pour devenir une URL, et une destination définie pour chaque ligne qui échoue au test.
Le fait de considérer cette barrière comme le centre de la conception plutôt qu'un contrôle de sécurité tardif change ce qui est réellement construit. Cela change le schéma, car la porte a besoin de champs qu'elle peut tester. Il change la surface de la rampe, car les rangées défaillantes ne doivent jamais atteindre le plan du site. Et cela change l'estimation, qui est d'où vient la cote de difficulté du catalogue: cher et complexe décrit le coût de la porte, et non le coût de la boucle qui rend les pages.
Les cinq choses qu'une rangée doit transporter avant qu'elle ne gagne une URL
Premièrement: demande indépendante. Quelqu'un doit chercher cette combinaison spécifique. Une table peut générer chaque couple de deux cents services avec quatre cents villes, et chacune de ces quatre-vingt mille paires peut exister alors qu'une fraction seulement d'entre eux sont dactylographiés par un être humain. Les lignes sans signal de demande ne sont pas des pages sous-performantes. Ce sont des pages qui n'allaient jamais être visitées, et leur seul effet mesurable est sur le budget de rampe.
Deuxièmement : au moins un fait qui change non trivialement d'une rangée à l'autre. Pas le nom dans le titre — un numéro, une date, une contrainte, une personne nommée, une règle qui s'applique ici et non à côté. Troisièmement, une entité vérifiable derrière la rangée. Si la page réclame un service dans une ville, le service dans cette ville doit être réel, parce que le moyen le plus rapide de perdre une construction programmatique est un examinateur découvrant que l'adresse existe et l'offre derrière elle ne le fait pas.
Quatrièmement: quelque chose que le visiteur peut faire à côté qui appartient spécifiquement à cette ligne — le contact local, le stock réel, le formulaire applicable, l'estimation de livraison correcte. Un seul appel partagé à l'action sur dix mille pages est un signal honnête que les pages sont partagées aussi. Cinquièmement: un propriétaire nommé et une date de rafraîchissement, parce qu'une ligne qui était vraie à la publication et est discrètement faux dix-huit mois plus tard est une version plus lente, plus coûteuse de la même défaillance.
Cinq conditions sont un filtre strict et il est censé être strict. Appliqué honnêtement à une table de vingt mille rangées, il laisse habituellement quelques milliers debout, et ces quelques milliers sont ceux qui justifient la bande de 500 $ – 2 500 $. Un projet qui ne peut pas survivre au filtre n'a rien perdu du tout. Il a simplement découvert avant de publier ce qu'il aurait autrement découvert après, à un moment bien pire et avec beaucoup moins de place pour agir.
Lorsque le tableur cesse de se comporter comme un tableur
Les ensembles de données qui semblent rangés dans un viewport se comportent très différemment à la rangée neuf mille. Les cellules vides semblent que le schéma n'a jamais prévu. La même ville arrive épelé trois façons. Deux fournisseurs utilisent des unités différentes pour la même mesure. Une colonne de prix contient une fourchette en certaines lignes et une seule figure en d'autres. Rien de tout cela n'a d'importance alors qu'un humain lit la table, et tout cela importe à l'instant où un modèle rend ces valeurs directement dans une rubrique.
Les jointures sont pires que les nuls. Les pages programmatiques ont presque toujours besoin de deux sources ou plus: un catalogue et une géographie, un flux de produits et une fiche de spécifications, un tableau de disponibilité et une règle de prix. Les rangs qui ne s'unissent pas ne disparaissent pas poliment. Ils produisent une page avec un titre, une phrase modèle et rien en dessous, ce qui est la forme exacte de la politique de contenu à l'échelle décrit.
La défense est peu glamour et très spécifique : un laissez-passer de validation qui court avant le rendu plutôt qu'après la publication, avec des règles explicites par champ et une destination explicite pour chaque échec. Les lignes qui passent deviennent des pages. Les lignes qui échouent vont dans une file d'attente de révision, ou dans une page de catégorie qui les regroupe honnêtement, ou nulle part du tout. La seule option qui ne doit pas exister est une ligne qui échoue tranquillement et devient une page indépendamment de ce que le validateur pensait.
C'est pourquoi le catalogue cite de 3 à 7 jours pour un pilote de 500 à 1000 pages plutôt qu'un après-midi. Une boucle de rendu sur une table propre est vraiment un après-midi. Les jours vont à décider ce que signifie propre pour ce jeu de données particulier, en écrivant les vérifications qui font appliquer cette définition, et en lisant les lignes rejetées avec vos propres yeux avant qu'une seule URL soit exposée à un rampeur. Cette lecture est la partie que personne n'aime et personne ne peut sauter.
Métadonnées est le calque de clic et il ne peut sauver la page ci-dessous
La deuxième entrée de catalogue est la génération de masse de titres et de descriptions avec AI, classés sous Meta tags, prix de 150 $ – 700 $ par paquet, avec débit indiqué clairement comme 3–6 heures par 500 pages une fois l'invite configurée. Sa difficulté est la note la plus douce du catalogue — débutant. La description définit précisément les attentes : des centaines de titres et de descriptions réécrits en une journée, uniques, en longueur, avec un appel clair et sans spam, avec des positions inchangées et des clics plus élevés.
Lisez cette dernière clause lentement, parce que c'est à la fois l'argument entier pour le service et la limite entière de celui-ci. Les métadonnées ne déplacent pas une page vers le haut des résultats. Cela change combien de personnes choisissent la page une fois qu'elle est déjà assise là. Une page classé onzième avec une meilleure description est toujours classé onzième. Une page se classant quatrième avec une description qui indique enfin ce qui est sur elle recueille une part différente des clics qu'elle était déjà admissible.
C'est pourquoi les deux services appartiennent à cet ordre et non à l'inverse. L'exécution de métadonnées de masse sur un ensemble de pages minces et quasi identiques produit un ensemble de pages minces et quasi identiques avec de meilleurs titres, et de meilleurs titres amènent plus de gens à une page qui les décèle plus rapidement qu'auparavant. L'ascenseur est réel quand la page a quelque chose sur elle et purement cosmétique quand il ne le fait pas, et aucune prompte ne peut dire ces deux situations en dehors de l'extérieur.
La forme des prix porte le même message. Les petits volumes sont cités par page — de 300 à 800 livres chacun — alors que les paquets sont cités entiers: 15 000 à 35 000 livres pour cent pages et de 50 000 livres pour mille. Le prix unitaire diminue à mesure que le volume augmente parce que les pièces chères sont la prompte, les règles de longueur et l'échantillon de révision plutôt que la génération elle-même. C'est précisément pourquoi les heures indiquées ne commencent qu'après la mise en place de l'invite.
Le pilote est un argument que vous soumettez à l'index
Le catalogue est particulièrement précis sur la portée ici: 3-7 jours pour un pilote de 500 à 1000 pages. Un pilote de cette taille n'est pas une répétition pour la vraie construction et ne doit pas être traité comme un seul. C'est une question posée à un moteur de recherche dans la seule langue que répond un moteur de recherche — publier un échantillon limité et honnête de la forme que vous comptez produire au volume, puis regarder, sans argumenter, ce que l'index décide de faire avec.
La lecture est ensuite simple. Pages rampées et indexées signifie que la forme a été acceptée et que le risque restant est la demande plutôt que la qualité. Pages rampées et non indexées signifie que la ligne ne contient pas assez pour justifier une page, quoi que le modèle en parle, et l'échelle ne ferait que multiplier un rejet que vous avez déjà en main. Les pages ne rampent pas à tous les points de liaison interne ou le plan du site, qui est plomberie et le moins cher des trois à réparer.
Les niveaux roubles du catalogue sont dessinés exactement le long de cette couture. La gamme complète est de 30 000 à 100 000 pages, divisée en un projet pilote de 500 à 1000 pages à 30 000 à 50 000 pages et de 2000 à 5000 pages à 70 000 à 100 000 pages. Le deuxième niveau n'est pas plus élevé parce que les pages supplémentaires coûtent plus cher à rendre. Il est plus élevé parce qu'à ce volume la porte, la surveillance et le cycle de rafraîchissement doivent continuer à travailler sans que personne ne les regarde quotidiennement.
La discipline qui fait qu'un pilote vaut son prix refuse d'augmenter sur un calendrier. Les pages publiées en premier devraient être les lignes les plus fortes du tableau plutôt qu'un échantillon aléatoire, parce que le but est de savoir si le meilleur cas fonctionne avant de dépenser de l'argent dans le cas moyen. Si les mille rangées les plus fortes ne sont pas indexées, les dix-neuf mille autres ne sont pas un plan de croissance qui attend d'être financé. Ils sont une table qui a besoin de plus de colonnes.
Ce que le plan trimestriel est vraiment pour: décider ce qui ne se produit jamais
La troisième entrée de catalogue est un plan de contenu trimestriel avec des mémoires rédigés pour les résultats liés à l'IA, classés sous Stratégie de contenu, au prix de 200 $ – 700 $, avec une durée de 1 à 2 jours. Sa description est concrète au sujet du livrable: un plan de trois mois prêt couvrant quels articles et pages d'atterrissage à écrire, dans quel ordre, contre quels clusters et avec quel effet attendu, avec un bref joint à chaque sujet afin qu'un auteur puisse écrire le texte sans votre implication.
Dans un projet programmatique, le plan fait quelque chose que la construction ne peut pas faire pour elle-même. Il décide quels groupes sont légitimement générateurs et ceux qui ne le sont pas. Des pages de comparaison sur une grille de spécifications peuvent être générées en toute sécurité. Un guide d'un règlement qui a changé le trimestre dernier ne peut pas, et un tableau qui essaiera de produire les pages les plus confiantes fausses sur l'ensemble du site. Le plan est le document où cette scission est faite délibérément plutôt que découverte par accident.
Le mémoire est le mécanisme qui rend la scission exécutoire plutôt qu'aspirationnelle. Un bref nom de la question que la page répond, les faits qu'elle doit contenir et la source de chaque fait est une spécification qu'un auteur humain peut satisfaire et un pipeline automatisé peut être testé contre. Il expose également les sujets vides tôt: si un bref ne peut pas nommer trois choses que la page doit contenir, le sujet n'a jamais été une page, et découvrir que dehors ne coûte rien au stade de la planification.
À 200 $ – 700 $ pour un à deux jours, le plan est la plus petite ligne des trois et celle qui change le plus les deux autres. La ligne rouble nomme une mini-stratégie à environ 15 000 , une norme à environ 30 000 , et une version étendue à 50 000 à 70 000 , . Ce que vous achetez, c'est le séquençage — qui est généré dans le pilote, qui reste écrit à la main, qui attend un quart — et le séquençage est l'endroit où vit la plupart des risques.
Arithmétique vous pouvez faire vous-même, et ce qu'il refuse de vous dire
Le catalogue publie un débit de métadonnées de 3 à 6 heures par 500 pages après la mise en place de l'invite. À titre d'exemple de l'échelle que bande sur papier — arithmétique un lecteur peut répéter, pas une mesure de n'importe quel projet — 2000 pages se trouvent quelque part entre 12 et 24 heures au même rythme, et 5000 pages entre 30 et 60. C'est le genre d'estimation qu'un acheteur peut vérifier avant d'accepter quoi que ce soit, c'est pourquoi la bande est publiée.
Le même exercice appliqué à la construction de page est plus révélateur pour ce qu'il refuse de céder. Trois à sept jours couvrent un projet pilote de 500 à 1000 pages, mais ces journées ne se divisent pas clairement en pages, car presque aucun effort n'est effectué par page. Doubler le nombre de lignes ne double pas le calendrier. Changer le nombre de sources de données, ou la rigueur de la porte de publication, le fait. Le coût de ce travail suit la structure beaucoup plus près qu'il suit le volume.
C'est aussi la lecture honnête des trois fourchettes de prix côte à côte. 500 $ – 2 500 $ pour les pages programmatiques, 150 $ – 700 $ pour un pack de métadonnées, 200 $ – 700 $ pour un plan trimestriel : la répartition à l'intérieur de chaque bande est la distance entre une source propre et plusieurs sources désordonnées, entre un modèle et un modèle avec des règles, entre un plan pour un cluster et un plan pour un trimestre complet. Volume vous déplace au sein d'un groupe; complexité vous déplace entre eux.
Un acheteur qui internalise qui cesse de négocier le prix par page et commence à poser une question plus productive: quelles parties de cette table sont déjà propres, et peut réduire le nombre de sources avant la construction plutôt que patché pendant elle. Cette conversation déplace une estimation plus fiable que jamais, car elle change le travail estimé au lieu de la marge assise sur elle.
Chaque fois que cela échoue a un nom, et chaque nom a une correction
La city-swap raconte : des pages qui ne diffèrent que par un nom propre, détectables en prenant deux d'entre eux, en supprimant le jeton variable et en comparant ce qui reste. Si le reste est identique, il en est de même des pages, peu importe le nombre de mots. La correction n'est pas une rotation ou une paraphrase synonyme, qui ne font que masquer le problème. La correction est d'ajouter un champ à la table qui diffère vraiment, ou de fusionner les lignes en une page qui couvre l'ensemble honnêtement.
La ferme orpheline : des milliers de pages accessibles uniquement via une carte du site, liées de rien et liées à rien. Une page que personne ne lie pour lire comme une page dont personne n'a besoin, et un plan du site est une suggestion plutôt qu'une approbation. La correction est structurale — pages hub par cluster, liens liés-row qui suivent les relations réelles déjà présentes dans les données, et une limite difficile sur la distance jusqu'où une page générée peut rester assise à partir de son hub le plus proche.
La table stale : la compilation fonctionne, l'index des pages, puis la source n'est plus jamais rafraîchie. Dix-huit mois plus tard, les prix sont erronés sur neuf mille pages à la fois, ce qui est un problème catégoriquement différent d'une mauvaise page. Le fix est un propriétaire nommé au lancement, une cadence de rafraîchissement écrite à côté de la construction, et un automatic unpublish pour toute ligne qui passe sa date d'expiration sans être revérifié par quelqu'un responsable.
Le mirage de métadonnées : titres et descriptions uniques s'étendent sur un ensemble de pages dont les corps ne sont pas uniques du tout. Il se lit comme une conformité dans un rapport rampant et comme une duplication à un lecteur réel. La correction est l'ordre des opérations — réparer les lignes en premier, générer les métadonnées en second — et le confort est que, à 3–6 heures par 500 pages, la passe de métadonnées est assez bon marché pour exécuter une deuxième fois une fois que les pages méritent les clics.
Questions et réponses
Combien coûte le référencement programmatique et combien de temps dure le premier lot ?
La génération de pages programmatiques du catalogue est de 500 $ – 2 500 $, avec une durée de 3 à 7 jours pour un pilote de 500 à 1000 pages. La ligne rouble s'étend de 30 000 à 100 000, divisée en 30 000 à 50 000 pour ce pilote et de 70 000 à 100 000 pour passer à 2000 à 5000 pages. La difficulté est la cote la plus difficile du catalogue: cher et complexe.
Les pages générées à partir d'un tableur seront-elles traitées comme du spam?
L'abus de contenu à l'échelle est jugé sur la valeur qu'une page offre à la personne qui y atterrit, et non sur la question de savoir si une machine l'a assemblée. Une page générée avec des prix réels, des actions et des détails locaux n'est pas le même objet qu'un modèle avec un nom de ville échangé. C'est pourquoi le catalogue juge ce service coûteux et complexe plutôt que débutant.
Puis-je corriger les pages faibles en réécrivant des titres et des descriptions au lieu de les reconstruire?
Seulement en partie. La génération massive de titres et de descriptions coûte 150 $ – 700 $ par paquet et fonctionne de 3 à 6 heures par 500 pages une fois l'invite mise en place, et le catalogue décrit précisément le résultat : positions inchangées, clics plus élevés. Il améliore la part de clics d'une page déjà admissible. Il ne peut pas ajouter de substance à une page qui n'en a pas.
Ai-je besoin d'un plan de contenu trimestriel si l'ensemble de données existe déjà?
Le plan décide ce qui ne devrait jamais être généré, ce que l'ensemble de données ne peut pas décider pour lui-même. Il coûte 200 $ – 700 $, prend 1 à 2 jours, et livre un calendrier de trois mois d'articles et des pages d'atterrissage par cluster avec un bref joint à chaque sujet, afin qu'un auteur puisse écrire le texte sans votre participation. Ce séquençage est l'endroit où se trouve la plus grande partie du risque.

