Seenthis
•
 
Identifiants personnels
  • [mot de passe oublié ?]

 
  • #e
  • #ex
  • #ext
  • #extra
  • #extract
  • #extractivisme
RSS: #extractivisme_culturel

#extractivisme_culturel

  • @klaus
    klaus++ @klaus 27/07/2026
    21
    @biggrizzly
    @mammut
    @arno
    @fonkisifou
    @simplicissimus
    @vanderling
    @sombre
    @olaf
    @mfmb
    @severo
    @02myseenthis01
    @ericw
    @kent1
    @colporteur
    @grommeleur
    @lejournalcorrosif
    @rastapopoulos
    @touti
    @mad_meg
    @roinu
    @spip
    21

    Aujourd’hui est le jour de la disparition de seenthis.net des indexes des moteurs de recherche, pas vrai ?

    https://www.clipartmax.com/png/middle/108-1087303_spy-vs-spy-white-spy-black-spy.png

    Bing
    ▻https://www.bing.com
    site:seenthis.net -> rien

    Startpage
    ▻https://www.startpage.com/sp/search
    site:seenthis.net -> rien
    seenthis.net -> n’importe quoi sauf du comtenu de seenthis.net

    Ecosia
    ►https://www.ecosia.org
    host:seenthis.net -> n’importe quoi sauf du comtenu de seenthis.net
    site:seenthis.net -> rien

    Qwant
    ►https://www.qwant.com
    pareil

    Lilo
    ►https://www.lilo.org
    Recherche de : seenthis.net -> O.K. pertinent
    Loin d’être complet, je ne sais pas, si Lilo archive les pages seenthis.
    Le recherche pour « seenthis.net #Attualità » de donne aucun résultat et je ne trouve pas de documentation de la syntaxe de Lilo.

    Google
    ▻https://www.google.com/search?q=host%3Aseenthis.net+Taxinotruf
    site:seenthis.net -> rien
    site:seenthis.net Taxinotruf -> pareil sauf que Google me pose des questions sur l’endroit où je me trouve etc. ...

    Duckduckgo
    ►https://duckduckgo.com
    site:seenthis.net -> rien
    seenthis.net -> n’importe quoi sauf du comtenu de seenthis.net

    Duck.AI
    ▻https://duckduckgo.com/#chat

    Question :

    Est-ce que duckduckgo connaît le site web ►https://seenthis.net ?

    Réponse GPT 5.4. :

    Oui, DuckDuckGo (et donc l’interface Duck.ai) peut connaître et référencer des pages de seenthis.net via son moteur de recherche, comme pour beaucoup d’autres sites.

    Question :

    Alors montre moi le lien vers un billet seenthis avec l’expression Taxinotruf

    Réponse GPT 5.4 nano :

    Je n’ai pas trouvé de billet seenthis.net qui contienne l’expression “Taxinotruf”. Si tu veux, je peux réessayer avec une variante (maj/min, “Taxino truf”, ou juste une partie du mot).

    Recherche dans seenthis :
    ▻https://seenthis.net/recherche?recherche=Taxinotruf
    Résultats
    ►https://seenthis.net/messages/1156583 (c’est précis, il y 6 mois))
    ▻https://seenthis.net/messages/799490 (c’est précis. 31/08/2019)

    Je n’ai pas testé davantage et il est possible que cette situation dure déjà depuis un certain temps.

    J’ai testé avec d’autres domains tld et j’obtiens des résultats pertinents. Conclusion : les moteurs n’indexent plus seenthis.net.

    Je crois que depuis l’installation d’Anubis qu’il y a un problème d’archivage de seenthis.net par archive.org ...

    Recherche dans archive.org
    ►https://web.archive.org
    ▻https://web.archive.org/web/20260000000000*/https://seenthis.net
    Ca y est mais ce n’est pas complet. Il faudrait compléter les archives suivant cette page d’explications :
    ▻https://help.archive.org/help/uploading-a-basic-guide

    Sur la page ►https://web.archive.org on peut simplement indiquer l’URL à archiver. J’ai l’impression qu’Anubis crée un problème ici car archive.org produit un message avertissant l’utilisateur d’un délai inattendu. En chechant pour la page à archiver on obtient un message qui indique que la page n’a pas été archivée.

    Cette page est assez compréhensible :
    ▻https://help.archive.org/help/using-the-wayback-machine

    L’archive internet étant sous pression cette page ne correspond plus exactement à l’interface il faudrait se référer à ce guide ou creuser davantage :
    ▻https://archive.org/developers/internetarchive

    Conclusion : Le projet de seenthis.net est plus important que jamais car il faut recommencer à construire ses propres archives et indexes après la disparition d’un nombre important de fonctions des moteurs de recherche. Ce processus a commencé avec le « personnalisation » des résultats de Google et prend des formes hallucinantes depuis le rempacement des méthodes de recherche avancée par l’IA industrielle. Cette IA est utile entre autres pour les condensés de pages web, mais les monopoles de l’internet rendent de plus en plus difficile d’identifier des sources précises et de raconter les histoires sur base de résultats des recherches dans l’internet.

    Pour rendre plus utile et efficace #seenthis.net il faudrait revoir qui peut l’indexer et ouvrir un peu les portes pour archive.org et les autres #white_hat de l’internet.

    #seenthis #archives #moteur_de_recherche #IA #Anubis

    klaus++ @klaus
    • @simplicissimus
      Simplicissimus @simplicissimus 27/07/2026

      https://pixelfed.zoo-logique.org/storage/m/_v2/493806419159965724/4c90d8e69-c5a1c2/BKCxuyDIug2y/eznyjKWgSEohgTCIG25RCpW3tGxRAMcp17pDm7v3.png

      épiçétou !
      pourquoi celui-là ?

      Simplicissimus @simplicissimus
    • @fonkisifou
      Fonkisifou @fonkisifou CC BY-NC-SA 27/07/2026

      ca veut dire qu’on est tous perdu dans le dark ouèb maintenant ?

      Fonkisifou @fonkisifou CC BY-NC-SA
    • @simplicissimus
      Simplicissimus @simplicissimus 27/07/2026

      là, y a un truc !

      https://pixelfed.zoo-logique.org/storage/m/_v2/493806419159965724/4c90d8e69-c5a1c2/iuR8wacdlJWu/5fNXuZCXpkIxfUulmCI2D2olDNVvpSEtYcYBIBbS.png

      MAIS…

      https://pixelfed.zoo-logique.org/storage/m/_v2/493806419159965724/4c90d8e69-c5a1c2/83M1kxnDmrRQ/RQkFq0mX6VY34B8vAeMJ2amMsSfrGOaKrUJpNVq1.png

      Simplicissimus @simplicissimus
    • @simplicissimus
      Simplicissimus @simplicissimus 27/07/2026

      ça fait peur !
      #pillage #extractivisme_culturel

      tiens, il en dit quoi, le loulou ?

      https://pixelfed.zoo-logique.org/storage/m/_v2/493806419159965724/4c90d8e69-c5a1c2/drFdzmYJV4Yt/YAi6ImQukgqIVjPcYaxX8TslTbUcfyDOeBfb3reI.png

      Simplicissimus @simplicissimus
    • @biggrizzly
      BigGrizzly @biggrizzly CC BY-NC-SA 27/07/2026

      Pour apporter de l’eau au moulin :
      – cela fait des mois que les moteurs de recherche se prennent des erreurs sur seenthis
      – j’ai maintenu les erreurs systématiques pour les bots depuis la mise en place d’anubis
      – j’ai mis sous anubis les feed (rss) aussi, parce qu’ils étaient allègrement pillés en continu, au point de tripler la charge de la machine

      Depuis toutes ces actions, la machine ne consomme quasiment plus de ressources. La consommation par les humains ne réclame quasiment pas de ressources. Alors soit nous sommes désormais quasiment plus que quelques uns à consulter. Soit il y a trop de robots.

      Personnellement, j’oscille entre l’embargo complet, parce qu’il n’y a pas de raison qu’on se fasse piller et l’ouverture à des moteurs bienveillants, mais avec la certitude que ces derniers se feront à leur tour piller.

      D’où l’oscillation, qui m’amène même à une position encore plus radicale. Les moteurs de recherche ne servent plus à rien, ignorons et bloquons les une bonne fois. Par quoi les remplacer ? C’est une vraie question...

      BigGrizzly @biggrizzly CC BY-NC-SA
    • @biggrizzly
      BigGrizzly @biggrizzly CC BY-NC-SA 27/07/2026

      https://pixelfed.zoo-logique.org/storage/m/_v2/493151427756716033/4c90d8e69-c5a1c2/qDMyjlOACoEr/XrWeJGB3smYXdxt2rIVJUCQgWy6TpXXXLd9lMZfy.png

      BigGrizzly @biggrizzly CC BY-NC-SA
    • @simplicissimus
      Simplicissimus @simplicissimus 27/07/2026

      j’hallucine ;-)

      Simplicissimus @simplicissimus
    • @vanderling
      Vanderling @vanderling 27/07/2026

      Dr Seenthis | Spy vs Spy
      ▻https://www.youtube.com/watch?v=mKgGQzMUSkE

      Vanderling @vanderling
    • @mfmb
      MFMB @mfmb 27/07/2026

      Comme je n’ai pas tout compris je demande. Des nouvelles personnes pourront encore s’inscrire à seenthis ?

      MFMB @mfmb
    • @biggrizzly
      BigGrizzly @biggrizzly CC BY-NC-SA 27/07/2026

      L’inscription est toujours ouverte, oui, bien sûr.

      Par exemple, un agent IA pourrait s’inscrire à seenthis et tout lire, s’il le souhaitait, s’il était capable de passer le barrage d’anubis et s’il était en mesure d’avoir un user-agent d’un navigateur standard.

      BigGrizzly @biggrizzly CC BY-NC-SA
    • @mfmb
      MFMB @mfmb 27/07/2026

      Si seenthis n’existe plus comment s’inscrire ? J’ai tapé seenthis et j’arrive à des trucs improbables comme
      ▻https://seenthis.co
      Je ne trouve plus LE seenthis

      MFMB @mfmb
    • @biggrizzly
      BigGrizzly @biggrizzly CC BY-NC-SA 27/07/2026

      Tu publies sur SeenThis, c’est que tu le trouves encore ? :-))

      Et si les humains en parlent entre eux, n’est-ce pas préférable à être trouvé par un moteur de recherche cybernétique possédé par une méta-corporation malfaisante ? C’est une question ouverte, qui mérite débat. Alors débattez ! ;-)

      BigGrizzly @biggrizzly CC BY-NC-SA
    • @vanderling
      Vanderling @vanderling 27/07/2026

      Entendu ce matin dans cet épisode sur france-cul’
      ▻https://www.radiofrance.fr/franceculture/podcasts/ils-ont-change-le-monde/1991-quand-le-web-devient-accessible-9206848
      au début de l’internet, les gougnafiers du web étaient surnommés « les vendeurs de canigou ». y’en a eus ici mais comme personne n’était intéressé par leurs croquettes, ils sont allés les vendre ailleurs.

      Vanderling @vanderling
    • @mfmb
      MFMB @mfmb 27/07/2026
      @biggrizzly

      @biggrizzly je retrouve seenthis qui est dans ma barre des taches certes mais plus à partir de mon téléphone.

      MFMB @mfmb
    • @biggrizzly
      BigGrizzly @biggrizzly CC BY-NC-SA 27/07/2026

      Y-a qu’à cliquer sur ►https://seenthis.net sur le téléphone pourtant ?

      Va falloir malgré tout faire le nécessaire pour laisser les moteurs indexer quelques pages du site ? C’est une idée ça...

      BigGrizzly @biggrizzly CC BY-NC-SA
    • @mfmb
      MFMB @mfmb 27/07/2026
      @biggrizzly

      @biggrizzly oui j’arrive avec le téléphone.Merci désolée pour les interruptions.

      MFMB @mfmb
    • @touti
      vide @touti 28/07/2026
      @arno

      Oui voila, bonne idée, on laisse des pages de présentation dont lq page de login et cette conversation ? Info complètemet fausse d’ailleurs, si @arno ne doit pas googler un acteur c’est parce que les batiments de google risquent d’être immédiatement recouverts d’un épais nuage de fientes de goëlands.

      vide @touti
    • @klaus
      klaus++ @klaus 28/07/2026

      Pages index.html pages de présentation du projet et sitemap statiques ouverts à tous et fermeture complète du contenu dynamique pour les robots/scraper etc.
      J’aimerais apprendre comment configurer le machin. Grand merci !

      #vie_privée

      klaus++ @klaus
    • @biggrizzly
      BigGrizzly @biggrizzly CC BY-NC-SA 28/07/2026

      Une proposition...

      Pages autorisées à tous :

      – ►https://seenthis.net > cette page contient les derniers messages publiés
      – ►https://seenthis.net/francais/article/c-est-quoi-seenthis
      – ►https://seenthis.net/francais/article/le-minimum-%C3%A0-savoir
      – ►https://seenthis.net/francais/article/automatismes-et-aspects-semantiques
      – ►https://seenthis.net/francais/article/moteur-de-recherche

      Pages interdites à toute navigation non-identifiée et à tous les bots (robots.txt + analyse du user-agent)

      – ►https://seenthis.net/all
      – ►https://seenthis.net/people
      – ►https://seenthis.net/messages
      – ▻https://seenthis.net/tag
      – ►https://seenthis.net/recherche

      Voyez-vous d’autres pages dont il faudrait discuter le traitement ?

      A propos du fichier sitemap.xml, faut-il le laisser en l’état ?

      A propos des flux RSS (urls */feed), elles sont toutes passées sous Anubis, bloquant l’essentiel des bots les consommant à longueur de temps.

      Pour rappel, les trois niveaux de protection :

      – protection Anubis, qui impose au navigateur une preuve de travail calculatoire, peu importe qui se présente

      – protection sur le user-agent (l’identité du navigateur), où on renvoie une erreur 429 dès que le user-agent contient certains mots clefs (comme les 3 lettres « bot »). J’ai inclus un « friendly bot » récemment, pour permettre aux instances Mastodon de venir lire les pages quand un lien vers SeenThis est posté sur Mastodon.

      – protection de la recherche, qui n’est autorisée qu’aux comptes identifiés.

      Tout cela n’est pas trivial à implémenter, mais c’est déjà une sorte de petit cahier des charges. N’hésitez pas à le compléter.

      BigGrizzly @biggrizzly CC BY-NC-SA
    • @mammut
      mammut @mammut 28/07/2026
      @klaus @touti @biggrizzly

      Pages index.html pages de présentation du projet et sitemap statiques ouverts à tous et fermeture complète du contenu dynamique pour les robots/scraper etc

      +1 @klaus
      +1000 @touti pour la trombe de fiente de goéland :))

      edit : +1 et merci @biggrizzly pour la proposition de solution

      mammut @mammut
    • @vanderling
      Vanderling @vanderling 28/07/2026
      @biggrizzly @odilon

      Une petite annonce de @biggrizzly il y a quatre mois suite à l’attaque des robots de l’enfer. ▻https://seenthis.net/messages/1166740
      et le tag #seenthis_outils établis par « l’intempestive » avant son départ et la suppression de tous ses seens et commentaires. Aude Vidal a aussi supprimé son compte et a fait effacer toutes ses traces. @odilon a disparue mais ses posts son toujours là. Inch’Allah.
      ►https://seenthis.net/tag/seenthis_outils

      Vanderling @vanderling
    • @klaus
      klaus++ @klaus 28/07/2026

      Dommage.
      Pas grave.
      À chacun/e sa paranoïa ;-)

      #intérêt_publique #journalisme #communication #histoire

      klaus++ @klaus
    • @touti
      vide @touti 28/07/2026
      @biggrizzly @mammut

      Impeccable ta liste @biggrizzly ++
      uhu @mammut marre des fakes des IA, rétablissons la vérité !

      Par contre, comme on est déjà dans un entre-soi certain, peut-être avoir un encart qui renvoie sur un texte pour expliquer et donner envie de nous rejoindre sur cette nouvelle politique seenthis ?

      vide @touti
    • @arno
      ARNO* @arno ART LIBRE 28/07/2026
      @nidal

      La difficulté de virer totalement les moteurs de recherche, c’est que ça revient à considérer Seenthis uniquement comme un réseau social. Or c’est aussi un outil de blog.

      Billets de blog qui du coup disparaissent des interwebz dès qu’on sort de Seenthis.

      Il m’est arrivé en début d’année de retomber sur un billet de @nidal suivi d’une discussion très constructive, via un moteur de recherche. Si on disparaît de Google, on perd ça qui me semble pourtant fondamental.

      Si c’était possible, il faudrait permettre de référencer toutes les pages /messages/1234, et donc un moyen d’y accéder.

      => Sinon pour être plus explicite : personnellement je conçois la protection du serveur uniquement dans l’optique de résister aux attaques de bots, qui rendent le site inutilisable. Par contre, le blocage contre la récupération des contenus par les IA, ça ne serait qu’un effet induit, mais pas un but au motif qu’on n’aime pas les LLM.

      ARNO* @arno ART LIBRE
    • @sombre
      Sombre @sombre CC BY-NC-SA 28/07/2026

      Bah, j’ai mis ce post en « épingle » sur mon compte BS :
      ▻https://bsky.app/profile/sombre-hermano.bsky.social/post/3ljmisjn7qc2c
      (avec le bouton <ALT> qui va bien avec l’image.

      Sinon le « Chat Mistral » m’a renvoyé quelques réponses sur une requête genre « que peux-tu me dire à propos de la plateforme Seenthis ? »
      Même qu’il a réussi à me loger en tant que « compte actif » mais il reconnaît que les utilisateurs·rices bénéficient de « l’anonymat » le plus total ! ... Quel boulet ce chat !

      https://rigolotes.fr/img/normal/20200106/1M6/20200106.jpg

      Sombre @sombre CC BY-NC-SA
    • @rastapopoulos
      RastaPopoulos @rastapopoulos CC BY-NC 28/07/2026
      @arno

      J’allais dire un peu comme @arno en découvrant ce fil : on n’est pas sur whatsapp là, c’est quand même un site avec du vrai contenu public utile, et le fait qu’il ne soit plus trouvable dans les vrais moteurs utilisés par les vrais gens mais que dans notre entre-soi, c’est quand même problématique.

      RastaPopoulos @rastapopoulos CC BY-NC
    • @b_b
      b_b @b_b PUBLIC DOMAIN 28/07/2026
      @biggrizzly

      @biggrizzly je suis dispo pour en causer demain si tu veux, pour dégrossir... Puis, il faudrait caler une session vocale/visio avec toutes les personnes intéressées par la question.

      b_b @b_b PUBLIC DOMAIN
    • @odilon
      odilon @odilon CC BY-NC-ND 29/07/2026
      @vanderling

      @vanderling coucou :) Pas totalement disparue, je garde un œil sur seenthis (seenthis c’est bien) mais je n’alimente plus depuis que je passe beaucoup beaucoup beaucoup moins de temps sur écran. Plus généralement je ne contribue plus aux réseaux sociaux, à part insta sur lequel je me mets quelques créa mais ici tout le monde s’en fout :) Je n’ai donc pas fermé mon compte ici et je laisse ce que j’y ai publié (sauf si ça dérange). Vas savoir, peut-être qu’un jour je reprendrai du service ! Bel été à toustes (et merci pour cette petite pensée pour moi).

      odilon @odilon CC BY-NC-ND
    • @sombre
      Sombre @sombre CC BY-NC-SA 30/07/2026
      @odilon

      Hello @odilon ! Content d’avoir de tes nouvelles. Je suis toujours ici et un peu moins ailleurs car c’est somme toute très chronophage tous ces réseaux. De plus, de nombreux soucis à gérer du côté de mes proches, problèmes de santé principalement. Donc je poste moins souvent ici. Bonne « route » à toi et protège-toi des « cramicules ». Personnellement, je fais régulièrement des crises de solastalgie mais je compte bien sur nos « bons maîtres » pour gérer mon « éco-anxiété ».

      https://pixelfed.fr/storage/m/_v2/791632196803044117/4c90d8e69-c5a1c2/7aSMxAFAEA4p/wpmkE3hzmmhnjwavSvpSTWaBvfkSGg3XaZxVRXK1.webp

      Source : ▻https://bsky.app/profile/zgur.eurosky.social/post/3mrhoexu4bs2c

      puisque, apparemment, ce serait un problème de « santé mentale »

      https://pixelfed.fr/storage/m/_v2/791632196803044117/4c90d8e69-c5a1c2/IJaSTVwbWdgT/pibmynF5OK9dAoZCsGQivT2XnTogtxWeI1sqS6EY.webp https://pixelfed.fr/storage/m/_v2/791632196803044117/4c90d8e69-c5a1c2/BGdY7ndwNheA/jrMbOvhB8T7Zgy9LqsDFLp9wpW8IbE53MFCqM3hf.webp

      Sombre @sombre CC BY-NC-SA
    • @sombre
      Sombre @sombre CC BY-NC-SA 30/07/2026
      @klaus

      Déso pour le trollage @klaus et les autres participant·es ...

      Sombre @sombre CC BY-NC-SA
    • @biggrizzly
      BigGrizzly @biggrizzly CC BY-NC-SA 30/07/2026
      @b_b

      Ma réflexion sur l’ouverture ou pas du site aux bots est contradictoire.

      1. J’estime que nous sommes à un point où nous ne devrions pas donner quoi que ce soit à ces bots, du fait que leurs propriétaires ne nous veulent pas du bien. C’est une position politique d’autodéfense.

      2. Techniquement, je sais que s’ils souhaitent venir consommer nos contenus, ils le peuvent, c’est moins facile, mais c’est sans espoir, nous ne pouvons pas totalement protéger nos contenus si nous ne voulons pas rendre le site inutilisable.

      3. Nous n’avons rien à cacher, certes. Mais tout de même, si on pouvait éviter d’alimenter le Léviathan, ça serait mieux.

      4. Pourquoi devrait-on utiliser un moteur de recherche extérieur pour accéder aux contenus de SeenThis ? Le souci est-il que le moteur de recherche actuel est imparfait ?

      5. Question plus générale. Pourquoi considère-t-on naturel de faire appel à des moteurs de recherche extérieurs, qui sont en quelque sorte un service public d’accès à l’information ? Ne devrait-on pas disposer chacun de son araignée personnelle qui parcourt le web afin d’alimenter notre index personnel de l’Internet ?... Il y a un souci dans la délégation actuelle à des moteurs de recherche qui peuvent décider d’invisibiliser certains contenus, ou au contraire d’en pousser d’autres. Et il n’y a aucun projet politique visant à assurer une neutralité minimaliste à ces outils (rien que définir cette neutralité est casse gueule, mais je pose la question, c’est déjà un premier pas).

      Conclusion d’étape :

      Il y a deux camps :

      – celui de l’ouverture pour exister sur les Internet ;
      – celui de la fermeture complète, parce que marre.

      Comment on départage ? Comment on trouve un équilibre ?

      Pour la technique, merci @b_b pour ta disponibilité. Dès qu’on aura déterminé une direction, on tâchera de faire les choses dans l’ordre, avec un ou plusieurs tickets et tout et tout.

      BigGrizzly @biggrizzly CC BY-NC-SA
    • @biggrizzly
      BigGrizzly @biggrizzly CC BY-NC-SA 30/07/2026
      @odilon

      J’ajoute que coucou @odilon, content de te lire :-)

      BigGrizzly @biggrizzly CC BY-NC-SA
    • @vanderling
      Vanderling @vanderling 30/07/2026
      @odilon @klaus

      Pareil @odilon content de te lire et peut être à bientôt par ici. Pas sur Insta ou Meta, je boycott. je retombe parfois sur tes anciens seens, comme celui-ci ►https://seenthis.net/messages/448947 et bien d’autres qui donne matière à réflexion. Tout comme ce seen de référence de @klaus avec ses commentaires. Vous je ne sais pas mais moi je suis toujours aussi con. Un peu moins quand je regarde seenthis.

      Vanderling @vanderling
    • @touti
      vide @touti 30/07/2026
      @sombre

      @sombre excellent ! #couic

      vide @touti
    • @arno
      ARNO* @arno ART LIBRE 30/07/2026
      @biggrizzly

      @biggrizzly - Note que tu es passé de la mise en place d’une protection contre les DOS causés par le passage de bots sauvage (et c’était devenu totalement indispensable) à une fermeture parce que tu n’aimes pas qu’on nous prenne le contenu. Ça n’est pas du tout pareil, et je ne crois pas que ça ait été discuté en ces termes.

      – L’internet a très rapidement été dépendant des moteurs de recherche pour permettre aux gens de découvrir les contenus. Yahoo, Google. Et ça n’a jamais été des bienfaiteurs de l’humanité, mais des acteurs ultra-capitalistes, avec un rapport très paradoxal à l’accès et à la promotion de l’expression publique pour le plus grand nombre. De la même façon, les gros réseaux sociaux (tous horribles) ont servi, et servent encore parfois, à faire connaître des contenus hors de l’industrie des médias et de la pub.

      – J’ai cru comprendre que notre moteur de recherche exige – justement dans le cadre de la protection antibots – d’être un membre connecté de Seenthis. Donc pour le coup, notre moteur ne remplace pas, et de loin, un moteur externe.

      – Encore une fois : Seenthis a été conçu dans une optique de micro-blogging, pas un simple réseau social. Pour moi le fait de s’insérer le plus largement possible dans les différents outils du Web, c’est vital. Notamment le référencement, les agrégateurs de contenu, les réseaux sociaux…

      – Et par ailleurs je ne sais pas à quel point on doit se lancer dans des considérations sur « donner nos contenus ». Une large partie de notre vision du Web (et de nos usages pratiques) dépend de l’accès à des contenus fermés/protégés, en utilisant des outils de scrapping de contenus tels qu’archive.ph. Et les sites qui, justement, bloquent les accès à de tels outils d’aspiration de leurs contenus, hé ben c’est pas trop notre truc.

      ARNO* @arno ART LIBRE
    • @colporteur
      colporteur @colporteur CC BY-NC-SA 30/07/2026
      @arno

      Je ne me sens guère légitime pour critiquer le fonctionnement du moteur de recherche de seenthis, ne serait-ce que parce que je crois mal l’utiliser, mais, simplement, je signale qu’il m’arrive d’en employer un autre pour retrouver un contenu présent ici.

      édit suis plutôt de l’avis exprimé par @arno.
      d’autant qu’il est décisif de garder une ouverture (de la visibilité) alors que la tendance parait être aux seenthissien.nes qui s’absentent davantage qu’aux arrivant.es qui postent.

      colporteur @colporteur CC BY-NC-SA
    • @simplicissimus
      Simplicissimus @simplicissimus 30/07/2026
      @arno

      oui, plutôt d’accord avec la position d’@arno …

      le pb, c’est que ledit moteur de recherche a pour stratégie déclarée d’invibiliser ses sources ou, au minimum, de ne pas faciliter (euphémisme…) l’accès auxdites sources. Cf. ci-dessus, la recherche sur la Mongolie, tout est fait pour rester dans l’environnement de l’IA et continuer ou affiner sa recherche par une nouvelle requête (prompt)

      Simplicissimus @simplicissimus
    • @fonkisifou
      Fonkisifou @fonkisifou CC BY-NC-SA 30/07/2026

      Je fais plein de pubs pour seenthis et rezo (mais tout le monde s’en fout, je crois que je ne vous ai jamais ramené personne, snif).

      Sur les moteurs on vous trouve à peine (je sais plus comment j’étais tombé sur rezo.net mais j’étais à la limite du désespoir avant de tomber dessus).

      Si on revient aux sources :

      Mars 2009, nous sommes toujours là. Avec la même envie de vous faire partager nos lectures

      ►https://rezo.net/pourquoi

      J’ai toujours bénéficié de « vos lectures » et ça m’a énormément apporté.
      Ce serait dommage que d’autres acharnés et avides de comprendre le monde puissent pas vous trouver à cause des IA.
      (pour répondre à la question 4)

      Ca fait longtemps que je surveille les alternatives aux moteurs de recherche existant.
      Il est dit ici qu’il faut des moyens considérables pour avoir quelque chose d’efficace. Ca explique pourquoi il n’y en a que 4 (▻https://mamot.fr/@bendineliot/102507200895682574 ) et que les alternatives ne décollent pas.
      (question 5)

      Tout cela étant dit, politiquement c’est dur de ne pas être d’accord avec les points 1 2 et 3.

      Mais j’ai l’impression que l’IA nous dépasse tellement que c’est comme tenter de vivre sans électrons provenant du nucléaire (mon obsession, argh) en France.

      Fonkisifou @fonkisifou CC BY-NC-SA
    • @rastapopoulos
      RastaPopoulos @rastapopoulos CC BY-NC 30/07/2026

      Pour répondre à 4 (mais ça répond à 1 2 3 du coup) :
      – le moteur interne ne sert que pour les déjà-utilisateurices
      – le but de seenthis est bien de publier des contenus utiles à toutes, pas que aux gens qui ont déjà un compte seenthis
      – même si le moteur interne était ouvert à toutes : ça n’aurait quasiment aucun intérêt puisque pour ça il faut déjà connaitre le site… or c’est justement le fait que les contenus utiles soient indexables et indexés ailleurs qui fait que des inconnus peuvent les trouver

      RastaPopoulos @rastapopoulos CC BY-NC
    • @biggrizzly
      BigGrizzly @biggrizzly CC BY-NC-SA 30/07/2026

      A propos du fait de trouver SeenThis au moyen d’un moteur de recherche, je n’ai sans doute pas été assez complet dans mes prémisses.

      Le chemin que prend la fonctionnalité « moteur de recherche » chez les fournisseurs de cet oligopole est que tu ne trouveras plus de références aux ressources qui répondent à tes questions, mais uniquement des réponses à tes questions rédigées depuis les ressources que tu recherches.

      Si on est pessimiste, on conclue que même si SeenThis est indexé, jamais les portails de recherche ne te diront qu’ils ont utilisé son contenu pour répondre à la question posée. De mon côté, j’estime que c’est le chemin qui est en train d’être pris. Mais je sais que je suis exagérément pessimiste, et qu’il va rester possible d’accéder à des moteurs de recherche traditionnels.

      Ceci dit. Je n’ai pas découvert SeenThis par un moteur de recherche. On m’a dit qu’il existait, et je m’y suis inscrit et j’y suis resté. Je continue d’y alimenter mon compte. Alors même que j’apprécie aussi Mastodon et que je continue régulièrement de me demander pourquoi je n’ouvre pas une instance autonome de Mastodon... (je le sais, il faudrait la maintenir, et j’ai déjà bien assez de choses à maintenir... et il faudrait la modérer, et je déteste modérer et fréquenter les gens qui s’amusent avec les modérateurs... et surtout, il faudrait éviter de se faire bloquer par les autres instances, et quoi que très diplomate, j’ai quelques doutes quant à ce que l’instance reste connectée avec le reste du monde bien longtemps, à cause de la modération en particulier).

      J’ai essayé régulièrement, de retrouver certains de mes billets techniques au moyen des moteurs de recherche internes et externes, et je dois dire que j’ai toujours eu du mal pour les retrouver !

      Ce que je veux dire, c’est que je ne crois pas qu’on découvre SeenThis par les moteurs de recherche. Par contre, comme pour un site vitrine, on en vérifie l’existence et la notoriété, assurément.

      BigGrizzly @biggrizzly CC BY-NC-SA
    • @colporteur
      colporteur @colporteur CC BY-NC-SA 30/07/2026
      @simplicissimus

      Je n’ai pas non plus découvert seenthis par un moteur mais il m’est arrivé de chercher des seen en utilisant un moteur externe (faute de trouver).
      Là, comme le dit @simplicissimus, il semble que cela ne fonctionne plus (si par exemple je tape « chômeurs seenthis » y a R a part l’accès à un résumé de ce que seenthis relaie, qui est catastrophique).

      colporteur @colporteur CC BY-NC-SA
    • @b_b
      b_b @b_b PUBLIC DOMAIN 30/07/2026

      HS : pour les personnes qui galèrent pour retrouver un de leurs post ou un de ceux qu’elles ont étoilés, je rappelle l’existence de ce plugin firefox dont je suis le seul utilisateur à ce jour ^^

      ►https://addons.mozilla.org/fr/firefox/addon/seenthis-search

      b_b @b_b PUBLIC DOMAIN
    • @sombre
      Sombre @sombre CC BY-NC-SA 30/07/2026
      @b_b

      @b_b : c’est amusant car cet après midi, je suis tombé sur cette page en suivant justement un moteur de recherche, en l’occurence Zotop de chez Zaclys.

      ▻https://zotop.fr

      Et il y avait quelques résultats qui matchaient avec seenthis.net dont celui-ci :

      https://pixelfed.fr/storage/m/_v2/791632196803044117/4c90d8e69-c5a1c2/wPC8KUrsY789/0pkxyXraz8YBUWjXsepmz8vSKmCSeP7TgbCRBhVD.png

      Sombre @sombre CC BY-NC-SA
    • @roinu
      RoiNu @roinu 31/07/2026

      Je ne me sens pas très légitime pour intervenir ici parce que je ne suis pas développeur informatique, à peine bidouilleur, et pas celui qui a le plus d’ancienneté. D’ailleurs je ne vais pas prendre position faute d’avoir une opinion et encore moins une solution sur ce serpent diabolique qui se mord la queue.

      Mais je veux quand même en profiter pour dire deux trois choses :

      Premièrement une grande gratitude pour toutes celles et ceux qui ont bâti ce truc seenthis improbable et le maintiennent.

      Depuis quelques semaines je prends un peu plus conscience de l’ampleur de l’impasse dans laquelle se trouvent plein d’organisations avec le pillage par l’IA et le tournant historique des moteurs de recherche. Le fait que des créateurs de contenu (et souvent ce sont les meilleurs) se retirent de la toile me terrifie. C’est une bibliothèque qui brûle (et nous regardons ailleurs ;-)

      Et il y a tous ceux qui ont un modèle économique qui s’effondre. Dans le tas, il y a des gentils : petits e-commerçants, petits producteurs de contenus indépendants, médias alternatifs, artistes... Que restera-t-il dans seulement un an ?
      Je comprends mieux maintenant l’atrophie totale vers laquelle le nouveau paradigme mène internet.

      Finalement cela produit une sensation de fin d’un monde très perturbant. Un monde dans lequel je savais bien nager. D’une certaine manière, je faisais partie des winers de ce monde. Rien que cette prise de conscience me donne à réfléchir.
      Internet était riche, il s’appauvrit. Dans seulement un an, je pense qu’on pourra parler de méga enshittification, ou d’enshittification totale ou finale.

      Quand le supermarché ne vend plus que de la merde, on se demande si ce n’était pas lui qui était de la merde depuis tout ce temps malgré son sympathique rayon de bières artisanales locales... et il est temps d’aller au marché de producteurs et à l’épicerie autogérée.

      On arrête tout, on réfléchit, et c’est pas triste. Réduire beaucoup beaucoup beaucoup les écrans comme Odilon, c’est l’avenir, surtout si ça se remplace par des trucs bien.

      Désolé, tout ça n’aidera même pas à prendre une décision. C’est juste un partage d’état d’âme.

      RoiNu @roinu
    • @biggrizzly
      BigGrizzly @biggrizzly CC BY-NC-SA 31/07/2026

      La discussion n’est pas technique, à mon sens. Elle est sur les principes : dans quelle mesure où ouvre le contenu aux robots et aux milliardaires, c’est à dire dans quelle mesure où on offre des ressources matérielles et intellectuelles, gratuitement, et avec un espoir de retour proche de zéro, voire négatif.

      Jusqu’alors, la promesse de Google, c’était que Google allait dire qu’on existe, et nous on allait dire que c’est génial, Google ils aident à ce qu’on existe. Mais comme chez Google et chez les autres, ils sont en situation d’oligopole, ils ont décidé que le service rendu, dire qu’on existe, ce n’était pas assez rémunéré.

      Alors. Donc. Voilà. Tout le monde peut participer à la discussion. :-)

      Il y a aussi le sujet des flux RSS. Je ne pensais pas qu’un jour j’en arriverais à dire qu’ils sont nocifs. Mais sur SeenThis, leur nombre, et leur consommation par des bots avides, est à mon avis une des explications au fait qu’on ait des difficultés sur certains traitements, lorsqu’il y a de la montée en charge. Et ça pose donc la question de la pertinence d’avoir de laisser ces flux en accès libre (sans Anubis). Mais c’est un autre débat. Mais c’est un débat aussi.

      BigGrizzly @biggrizzly CC BY-NC-SA
    • @b_b
      b_b @b_b PUBLIC DOMAIN 4/08/2026
      @biggrizzly

      @biggrizzly une piste alternative à anubis qui remonte souvent ces temps-ci est iocaine ▻https://iocaine.madhouse-project.org

      - Serve identifiable bots garbage, with poisoned urls
      – Anything that hits a poisoned url gets 12 hours on the firewall.

      source ▻https://mastodon.roflcopter.fr/@algernon@come-from.mad-scientist.club/117036039914052825

      À étudier...

      b_b @b_b PUBLIC DOMAIN
    • @biggrizzly
      BigGrizzly @biggrizzly CC BY-NC-SA 6/08/2026

      C’est drôle, la dernière mise à jour de SPIP sur SeenThis a désactivé un élément de protection que j’avais placé à la sauvage dans le code de SPIP. Ce qui fait que plus aucun bot ne se fait bloquer du tout.

      Le résultat est en quelque sorte édifiant.

      Tu veux avoir le droit d’exister sur Internet ? Y compris en activant Anubis. Alors accepte de devoir assumer un trafic multiplié par 10.

      C’est en quelque sorte le tribut au dieu de l’Internet que tout un chacun se doit de verser.

      https://pixelfed.zoo-logique.org/storage/m/_v2/493151427756716033/9a26d276d-23d3a8/QtKhhPDYVUnP/YdqPrr1OdJ3B3zMBSc0L7g4HFTYjYFe0vsxVGkSo.png

      BigGrizzly @biggrizzly CC BY-NC-SA
    • @biggrizzly
      BigGrizzly @biggrizzly CC BY-NC-SA 6/08/2026

      Vous aurez noté que certains posts créés par RSS ne se créent plus convenablement (par exemple XKCD du jour). Ceci expliquant donc cela.

      BigGrizzly @biggrizzly CC BY-NC-SA
    • @rastapopoulos
      RastaPopoulos @rastapopoulos CC BY-NC 6/08/2026

      Et donc ça c’est même avec Anubis… et c’était quoi le blocage ajouté en plus ?

      RastaPopoulos @rastapopoulos CC BY-NC
    • @biggrizzly
      BigGrizzly @biggrizzly CC BY-NC-SA 6/08/2026

      SPIP a une protection sur le load du serveur. De plus, cette protection ajoute un aléa. Quand le load est trop élevé, les bots reçoivent une erreur 429. Sur la machine SeenThis, il y a un paramètre (une jail) fail2ban qui bloque les IP qui génèrent des erreurs 429. Dans la version personnalisée à la sauvage de SPIP, il n’y a pas d’aléas à l’envoi de l’erreur 429, et le load est toujours trop élevé. Et donc, les IP des bots sont systématiquement bannies au bout de 2 tentatives.

      Le graph des requêtes avant Anubis a environ le même aspect en moins pire. C’est à dire qu’il y a une croissance du trafic. Je tâcherais de sortir les deux graphs la prochaine fois que j’allume le PC :-)

      BigGrizzly @biggrizzly CC BY-NC-SA
    • @b_b
      b_b @b_b PUBLIC DOMAIN 6/08/2026
      @biggrizzly

      Arf, désolé @biggrizzly je ne savais pas et ne pouvais pas le savoir puisque l’installation n’était pas en git. Maintenant que c’est le cas, je pourrai faire les prochaines mises à jour sans perdre tes modifs.

      PS : il serait peut-être intéressant d’ajouter un point d’entrée dans SPIP pour permettre ta modif de manière plus pérenne. On en cause la semaine prochaine si tu veux.

      b_b @b_b PUBLIC DOMAIN
    • @biggrizzly
      BigGrizzly @biggrizzly CC BY-NC-SA 9/08/2026

      C’est amusant de voir la différence de volume avant/après Anubis.

      L’analyse sur les IP est intéressante aussi. On voit que les chinois ne passent pas (encore) Anubis.

      Et on constate que Apple est très ouvert dans son comportement. Il n’a qu’un seul user-agent, mais qu’est-ce qu’il est gourmand !

      Avant Anubis :

      https://pixelfed.zoo-logique.org/storage/m/_v2/493151427756716033/9a26d276d-23d3a8/C7fcOGZx2vGR/rRGxLUUoe1T4YmDyOPiONJpZpd7KHRLjF0tblsvc.png https://pixelfed.zoo-logique.org/storage/m/_v2/493151427756716033/9a26d276d-23d3a8/u1yyNDnFDFJd/EjUfjMDxSfIZmgc3wZb6MeBFhFK5RRXhPnYMwFKn.png https://pixelfed.zoo-logique.org/storage/m/_v2/493151427756716033/9a26d276d-23d3a8/S7g4gymER2Qb/hk0saYaSYWGBlsKU1ZChdgzQbQwzzMdxFLIfdRCe.png

      Après Anubis :

      https://pixelfed.zoo-logique.org/storage/m/_v2/493151427756716033/9a26d276d-23d3a8/fotisJifJXLh/6iwRN1C3UXxNs9hnMBJQtmRJPUaaQsnItCWAnh3l.png https://pixelfed.zoo-logique.org/storage/m/_v2/493151427756716033/9a26d276d-23d3a8/ICGJOJN5nHS2/ohYOciDZsadvr7eg9FEdVKxADnrw3xRuD7M9KGOj.png https://pixelfed.zoo-logique.org/storage/m/_v2/493151427756716033/9a26d276d-23d3a8/3wAfLmSfPgXs/YRD9M9Q3UrXPxTtyWhI1QJjILJTcJwt7oU35risj.png

      Si, comme vous semblez le vouloir, il faut s’ouvrir à fond les ballons à tous les techbros-sauveurs-du-capitalisme de la planète, je dirais qu’il faut améliorer SeenThis dans les directions déjà mentionnées dix fois je crois :

      1. Améliorer le fonctionnement du CRON interne, pour qu’il ne s’exécute pour de vrai qu’une seule fois par minute.

      2. Améliorer le fonctionnement de la création des posts par RSS, pour qu’ils ne se retrouvent pas bloqués par la surcharge du serveur, liée aux bots.

      3. Améliorer certaines requêtes très lentes (calcul des fils avec blocages).

      On pourra aussi sans doute, aussi, un de ces jours, réfléchir à la façon de construire les flux RSS sans qu’ils n’engendrent eux même des soucis de concurrence sur la base de données. Parce que si on ne les protège pas par Anubis, ils sont consommés à un rythme infernal.

      BigGrizzly @biggrizzly CC BY-NC-SA
    • @rastapopoulos
      RastaPopoulos @rastapopoulos CC BY-NC 9/08/2026

      1. Améliorer le fonctionnement du CRON interne, pour qu’il ne s’exécute pour de vrai qu’une seule fois par minute.

      Est-ce souhaitable, car ça veut dire seulement pile 1440 fois par jour, alors que s’il y a beaucoup de tâches de fond à faire, les jobs de SPIP se lancent « quand il y a un truc à faire » dès lors qu’il y a un hit PHP par quelqu’un (humain ou robot qui passe les portes).

      Quand il n’y a aucune tâche à faire à un instant T… ce cron n’est censé rien faire non ? Donc ça fait quoi comme surcharge, ça lance quoi de trop que ça ne devrait pas lancer ? Juste la « recherche de tâches à faire » (qui est vide si plus rien en stock) est déjà trop gourmande ?

      2. Améliorer le fonctionnement de la création des posts par RSS, pour qu’ils ne se retrouvent pas bloqués par la surcharge du serveur, liée aux bots.

      Ça se fait justement… dans les jobs/cron, donc si ça se lance plein de fois : ça fait avancer plus souvent l’importation. Là encore le diagnostique n’est super clair : c’est quoi qui bloque quoi ? Et de quelle manière ça bloque plus l’import de seen que les créations manuels par un humain dans l’interface ?

      3. Améliorer certaines requêtes très lentes (calcul des fils avec blocages).

      C’est le seul point pour lequel sans plus d’infos je pourrai avoir une intuition dont on avait parlé ya 5 ans ou plus déjà : si on s’assure d’indexer assez des bonnes informations nécessaires dans Manticore, alors l’ensemble des fils du site pourraient être générés avec, et non pas juste la page de recherche. Au moins les boucles principales de sélection. Càd : toutes les listes de chaque auteurices, tous les RSS, et les accueils de chaque personne et des anonymes. Les boucles/requêtes de Manticore sont beaucoup, beaucoup, plus rapides que les requêtes MySQL à priori.

      RastaPopoulos @rastapopoulos CC BY-NC
    • @biggrizzly
      BigGrizzly @biggrizzly CC BY-NC-SA 9/08/2026

      Autre graphique : nombre de requêtes qui durent plus de 5 secondes sur les 14 derniers jours.

      Plus il y a de monde qui consulte le site, plus il y a de pages qui se retrouvent bloquées.

      Il y a un souci de concurrence dans le code de seenthis, souci à corriger d’une façon ou d’une autre ; j’ignore où il se situe, et je ne fais en l’état que des propositions de pistes de recherche.

      https://pixelfed.zoo-logique.org/storage/m/_v2/493151427756716033/9a26d276d-23d3a8/Uh3HGVWEdqq0/RoVVzfWwGCCGNYEqLez92V9gjosVejunYaWlyWUb.png

      J’évoque le CRON car parfois, dans le passé, avant Anubis, j’ai constaté qu’il s’appelait de très nombreuses fois dans des intervalles de temps très courts, sans aucune raison valable. Du fait d’Anubis, je ne vois pas de cas comparable en ce moment. Je note des pics, avec des appels concentrés sur une même seconde.

      Ici, on voit qu’à 09h09 le 7 août, on a une vingtaine d’appels. Je soupçonne des soucis de ce point de vue là, s’il manque une vraie section critique. Ceci dit, ces appels, présentement, ont tous duré moins de 100ms.

      https://pixelfed.zoo-logique.org/storage/m/_v2/493151427756716033/9a26d276d-23d3a8/aOyaX8K5a5mw/jj4ghbjzSR60gRvZo1MYJDLQvXAjXPBZ1zURn5GF.png

      Par principe, je désapprouve les webcrons. Quand on a besoin de faire exécuter qq chose régulièrement, si on en a la possibilité, je trouve un vrai gestionnaire de tâches planifiées préférable. Mais si le CRON de SPIP est conforme tant mieux. Il n’empêche qu’il lui arrive de s’emballer, à mon sens, de ce que je vois dans les journaux apache.

      Concernant les posts créés par RSS, dès qu’il y a de la concurrence, ils apparaissent sans contenu dans les fils. Pendant toute la durée de bannissement des bots, les posts RSS se sont créés sans difficultés. Depuis que c’est rouvert, on a à nouveau de tels soucis. Ceci dit ces soucis se résolvent d’eux même quand les posts passent en page 2. C’est apparemment un souci de mise en cache du post, quand le post est créé, et qu’en même temps la page d’accueil est réclamée.

      BigGrizzly @biggrizzly CC BY-NC-SA
    • @biggrizzly
      BigGrizzly @biggrizzly CC BY-NC-SA 9/08/2026

      L’envoi de mon commentaire a pris plus de 8 secondes. Ce n’est pas normal. Et ça n’a lieu qu’en situation de forte charge.

      (bis, ce second commentaire aussi, plus de 8 secondes)

      (ter, la validation de la modification du commentaire, plus de 20 secondes)

      Confirmation par les journaux : mes 4 validations successives.

      Pas un souci de concurrence pour le coup, y-a pas de surcharge présentement. Ça doit être lié à la structure de ce post plein de commentaires ?

      https://pixelfed.zoo-logique.org/storage/m/_v2/493151427756716033/9a26d276d-23d3a8/N4eXlpTY75JX/DsfilkSOpKdUZSvPhfytxoSrP1JnkZ7liNHOEDKO.png

      BigGrizzly @biggrizzly CC BY-NC-SA
    • @biggrizzly
      BigGrizzly @biggrizzly CC BY-NC-SA 9/08/2026

      C’est chouette, je tombe juste sur le souci de création de post depuis un RSS. Sur mon fil, ça affiche ça :

      https://pixelfed.zoo-logique.org/storage/m/_v2/493151427756716033/9a26d276d-23d3a8/BgTxkmyVW5Cp/qCVLtCbQGPcgra8zmGoJJtOP10zBgXofVjIvOacU.png

      BigGrizzly @biggrizzly CC BY-NC-SA
    • @inadvertance
      inadvertance @inadvertance PUBLIC DOMAIN 10/08/2026

      99% of My Website Traffic Is Bots

      ▻https://patronview.com/news/99-percent-of-my-website-traffic-is-bots

      Les observations et contre-mesures d’un autre galérien, lui avec Cloudflare.

      https://i.ibb.co/35Jm3sQw/image.png

      inadvertance @inadvertance PUBLIC DOMAIN
    • @b_b
      b_b @b_b PUBLIC DOMAIN 11/08/2026
      @biggrizzly

      @biggrizzly pour info, je viens de mettre à jour #seenthis en SPIP 4.4.18. J’ai vérifié avant de le faire, et il n’y avait pas de modifications locales. Je reviendrais plus tard dans ce fil pour discuter des points que tu listes plus haut.

      b_b @b_b PUBLIC DOMAIN
    • @biggrizzly
      BigGrizzly @biggrizzly CC BY-NC-SA 12/08/2026

      Juste pour discuter.

      On vient de faire un point sur la journalisation de nos serveurs web, qui permet de visualiser les stats comme dans mes commentaires précédents.

      On confirme le avant/après blocage des bots

      – Avant Anubis, trafic sans bots = 1, trafic avec bots = 6
      – Après Anubis, trafic sans bots = 1, trafic avec bots = 10

      On a multiplié le trafic par 10 depuis que les bots sont libres de consommer SeenThis.

      On ne stocke que 3 mois de journaux pour SeenThis. Mais un trafic multiplié par 10, plus le trafic supplémentaire impliqué par Anubis, ça augmente l’espace nécessaire pour les journaux.

      On doit aussi gérer d’autres absurdités des bots sur d’autres serveurs web. Par exemple le cas de ce bot meta qui consomme en continu les photos d’un blog qui a commencé sa vie au début du siècle. Des millions de lecture de photos lues et relues, toujours les mêmes, consommées en continu. On a bloqué meta globalement sur ce serveur mutualisé. C’est tellement absurde.

      Malgré nos mesures de nettoyage et de blocage, c’est une croissance du trafic qu’on constate, alors même que globalement, les moteurs de recherche, c’est de notoriété publique, ne renvoient plus de visiteurs.

      Bref, on ajoute ce matin 100Go de plus sur le serveur dédié aux journaux web, ça fait un petit serveur à 500Go d’espace total. Pour voir venir.

      Mon opinion est de plus en plus ferme. Les bots ne servent à rien d’autres qu’à nous imposer de rajouter des ressources sans aucun retour en échange. Le futur de la communication entre humains ne passe pas par les moteurs de recherche mais par les réseaux sociaux distribués. Peut-être devrions-nous tâcher de construire des moteurs de recherche distribués (ça n’existe pas en l’état, consommer des moteurs commerciaux ça n’est pas du moteur de recherche distribué).

      BigGrizzly @biggrizzly CC BY-NC-SA
    • @biggrizzly
      BigGrizzly @biggrizzly CC BY-NC-SA 12/08/2026

      StupidAntibot [Wiki de sebsauvage.net]
      ►https://sebsauvage.net/wiki/doku.php?id=stupidantibot

      (...)

      Alors bien sûr cela va aussi bloquer les bots indexeurs des moteurs de recherche, mais de toute manière Google n’est déjà plus capable d’afficher des résultats pertinents et il n’amène plus de trafic.

      Mon crédo : Écrire pour les humains, pas pour les robots. Donc je m’en fous totalement que tous les robots soient bloqués.

      (...)

      De l’eau au moulin :-)

      BigGrizzly @biggrizzly CC BY-NC-SA
    • @b_b
      b_b @b_b PUBLIC DOMAIN 14/08/2026

      Réponses un peu tardives...

      1. Améliorer le fonctionnement du CRON interne, pour qu’il ne s’exécute pour de vrai qu’une seule fois par minute.

      Je croyais que la solution que je proposais dans ▻https://github.com/seenthis/hebergement/issues/29#issuecomment-4104042165 faisait le job, ça n’est pas le cas ?

      2. Améliorer le fonctionnement de la création des posts par RSS, pour qu’ils ne se retrouvent pas bloqués par la surcharge du serveur, liée aux bots.

      Ça mérite un ticket dans ▻https://git.spip.net/seenthis/importer-flux/-/work_items :)

      3. Améliorer certaines requêtes très lentes (calcul des fils avec blocages).

      Ça fait 10 ans qu’on a un ticket à ce sujet ▻https://git.spip.net/seenthis/squelettes/-/work_items/159 mais personne ne s’y jamais vraiment collé :\

      Le futur de la communication entre humains ne passe pas par les moteurs de recherche mais par les réseaux sociaux distribués.

      Avec le temps qui passe et le peu d’énergies/volontés à dispo pour maintenir seenthis, je pense parfois (souvent ?) qu’une instance masto (ou autre) dédiée aux membres de seenthis ferait très bien le job.

      b_b @b_b PUBLIC DOMAIN
    • @fonkisifou
      Fonkisifou @fonkisifou CC BY-NC-SA 15/08/2026
      @biggrizzly

      ▻https://framapiaf.org/@framasky/117098596543170343

      Coucou @biggrizzly 😘

      Fonkisifou @fonkisifou CC BY-NC-SA
    Écrire un commentaire

Thèmes liés

  • #seenthis