Seenthis
•
 
Identifiants personnels
  • [mot de passe oublié ?]

http://www.bing.com

  • ►/bingbot.htm
  • ►/az
    • ►/hprichbg
      • ►/rb
        • ►/WallStreetNY_FR-FR9293687068_1366x768.jpg
  • ►/search
    • ►?q=%2bSchol+Meaix&filters=rcrse%3a%221%22&FORM=RCRE
  • ►/videos
    • ►/search
      • ►?q=Billie+Hollyday&view=detail&mid=364F06A669DFEEA9B4E3364F06A669DFEEA9B4E3&first=0
  • ►/community
    • ►/site_blogs
      • ►/b
        • ►/search
          • ►/archive
            • ►/2011
              • ►/05
                • ►/16
                  • ►/news-announcement-may-17.aspx
              • ►/02
                • ►/02
                  • ►/setting-the-record-straight.aspx
  • @klaus
    klaus++ @klaus 27/07/2026
    21
    @biggrizzly
    @mammut
    @arno
    @fonkisifou
    @simplicissimus
    @vanderling
    @sombre
    @olaf
    @mfmb
    @severo
    @02myseenthis01
    @ericw
    @kent1
    @colporteur
    @grommeleur
    @lejournalcorrosif
    @rastapopoulos
    @touti
    @mad_meg
    @roinu
    @spip
    21

    Aujourd’hui est le jour de la disparition de seenthis.net des indexes des moteurs de recherche, pas vrai ?

    https://www.clipartmax.com/png/middle/108-1087303_spy-vs-spy-white-spy-black-spy.png

    Bing
    ▻https://www.bing.com
    site:seenthis.net -> rien

    Startpage
    ▻https://www.startpage.com/sp/search
    site:seenthis.net -> rien
    seenthis.net -> n’importe quoi sauf du comtenu de seenthis.net

    Ecosia
    ►https://www.ecosia.org
    host:seenthis.net -> n’importe quoi sauf du comtenu de seenthis.net
    site:seenthis.net -> rien

    Qwant
    ►https://www.qwant.com
    pareil

    Lilo
    ►https://www.lilo.org
    Recherche de : seenthis.net -> O.K. pertinent
    Loin d’être complet, je ne sais pas, si Lilo archive les pages seenthis.
    Le recherche pour « seenthis.net #Attualità » de donne aucun résultat et je ne trouve pas de documentation de la syntaxe de Lilo.

    Google
    ▻https://www.google.com/search?q=host%3Aseenthis.net+Taxinotruf
    site:seenthis.net -> rien
    site:seenthis.net Taxinotruf -> pareil sauf que Google me pose des questions sur l’endroit où je me trouve etc. ...

    Duckduckgo
    ►https://duckduckgo.com
    site:seenthis.net -> rien
    seenthis.net -> n’importe quoi sauf du comtenu de seenthis.net

    Duck.AI
    ▻https://duckduckgo.com/#chat

    Question :

    Est-ce que duckduckgo connaît le site web ►https://seenthis.net ?

    Réponse GPT 5.4. :

    Oui, DuckDuckGo (et donc l’interface Duck.ai) peut connaître et référencer des pages de seenthis.net via son moteur de recherche, comme pour beaucoup d’autres sites.

    Question :

    Alors montre moi le lien vers un billet seenthis avec l’expression Taxinotruf

    Réponse GPT 5.4 nano :

    Je n’ai pas trouvé de billet seenthis.net qui contienne l’expression “Taxinotruf”. Si tu veux, je peux réessayer avec une variante (maj/min, “Taxino truf”, ou juste une partie du mot).

    Recherche dans seenthis :
    ▻https://seenthis.net/recherche?recherche=Taxinotruf
    Résultats
    ►https://seenthis.net/messages/1156583 (c’est précis, il y 6 mois))
    ▻https://seenthis.net/messages/799490 (c’est précis. 31/08/2019)

    Je n’ai pas testé davantage et il est possible que cette situation dure déjà depuis un certain temps.

    J’ai testé avec d’autres domains tld et j’obtiens des résultats pertinents. Conclusion : les moteurs n’indexent plus seenthis.net.

    Je crois que depuis l’installation d’Anubis qu’il y a un problème d’archivage de seenthis.net par archive.org ...

    Recherche dans archive.org
    ►https://web.archive.org
    ▻https://web.archive.org/web/20260000000000*/https://seenthis.net
    Ca y est mais ce n’est pas complet. Il faudrait compléter les archives suivant cette page d’explications :
    ▻https://help.archive.org/help/uploading-a-basic-guide

    Sur la page ►https://web.archive.org on peut simplement indiquer l’URL à archiver. J’ai l’impression qu’Anubis crée un problème ici car archive.org produit un message avertissant l’utilisateur d’un délai inattendu. En chechant pour la page à archiver on obtient un message qui indique que la page n’a pas été archivée.

    Cette page est assez compréhensible :
    ▻https://help.archive.org/help/using-the-wayback-machine

    L’archive internet étant sous pression cette page ne correspond plus exactement à l’interface il faudrait se référer à ce guide ou creuser davantage :
    ▻https://archive.org/developers/internetarchive

    Conclusion : Le projet de seenthis.net est plus important que jamais car il faut recommencer à construire ses propres archives et indexes après la disparition d’un nombre important de fonctions des moteurs de recherche. Ce processus a commencé avec le « personnalisation » des résultats de Google et prend des formes hallucinantes depuis le rempacement des méthodes de recherche avancée par l’IA industrielle. Cette IA est utile entre autres pour les condensés de pages web, mais les monopoles de l’internet rendent de plus en plus difficile d’identifier des sources précises et de raconter les histoires sur base de résultats des recherches dans l’internet.

    Pour rendre plus utile et efficace #seenthis.net il faudrait revoir qui peut l’indexer et ouvrir un peu les portes pour archive.org et les autres #white_hat de l’internet.

    #seenthis #archives #moteur_de_recherche #IA #Anubis

    klaus++ @klaus
    • @simplicissimus
      Simplicissimus @simplicissimus 27/07/2026

      https://pixelfed.zoo-logique.org/storage/m/_v2/493806419159965724/4c90d8e69-c5a1c2/BKCxuyDIug2y/eznyjKWgSEohgTCIG25RCpW3tGxRAMcp17pDm7v3.png

      épiçétou !
      pourquoi celui-là ?

      Simplicissimus @simplicissimus
    • @fonkisifou
      Fonkisifou @fonkisifou CC BY-NC-SA 27/07/2026

      ca veut dire qu’on est tous perdu dans le dark ouèb maintenant ?

      Fonkisifou @fonkisifou CC BY-NC-SA
    • @simplicissimus
      Simplicissimus @simplicissimus 27/07/2026

      là, y a un truc !

      https://pixelfed.zoo-logique.org/storage/m/_v2/493806419159965724/4c90d8e69-c5a1c2/iuR8wacdlJWu/5fNXuZCXpkIxfUulmCI2D2olDNVvpSEtYcYBIBbS.png

      MAIS…

      https://pixelfed.zoo-logique.org/storage/m/_v2/493806419159965724/4c90d8e69-c5a1c2/83M1kxnDmrRQ/RQkFq0mX6VY34B8vAeMJ2amMsSfrGOaKrUJpNVq1.png

      Simplicissimus @simplicissimus
    • @simplicissimus
      Simplicissimus @simplicissimus 27/07/2026

      ça fait peur !
      #pillage #extractivisme_culturel

      tiens, il en dit quoi, le loulou ?

      https://pixelfed.zoo-logique.org/storage/m/_v2/493806419159965724/4c90d8e69-c5a1c2/drFdzmYJV4Yt/YAi6ImQukgqIVjPcYaxX8TslTbUcfyDOeBfb3reI.png

      Simplicissimus @simplicissimus
    • @biggrizzly
      BigGrizzly @biggrizzly CC BY-NC-SA 27/07/2026

      Pour apporter de l’eau au moulin :
      – cela fait des mois que les moteurs de recherche se prennent des erreurs sur seenthis
      – j’ai maintenu les erreurs systématiques pour les bots depuis la mise en place d’anubis
      – j’ai mis sous anubis les feed (rss) aussi, parce qu’ils étaient allègrement pillés en continu, au point de tripler la charge de la machine

      Depuis toutes ces actions, la machine ne consomme quasiment plus de ressources. La consommation par les humains ne réclame quasiment pas de ressources. Alors soit nous sommes désormais quasiment plus que quelques uns à consulter. Soit il y a trop de robots.

      Personnellement, j’oscille entre l’embargo complet, parce qu’il n’y a pas de raison qu’on se fasse piller et l’ouverture à des moteurs bienveillants, mais avec la certitude que ces derniers se feront à leur tour piller.

      D’où l’oscillation, qui m’amène même à une position encore plus radicale. Les moteurs de recherche ne servent plus à rien, ignorons et bloquons les une bonne fois. Par quoi les remplacer ? C’est une vraie question...

      BigGrizzly @biggrizzly CC BY-NC-SA
    • @biggrizzly
      BigGrizzly @biggrizzly CC BY-NC-SA 27/07/2026

      https://pixelfed.zoo-logique.org/storage/m/_v2/493151427756716033/4c90d8e69-c5a1c2/qDMyjlOACoEr/XrWeJGB3smYXdxt2rIVJUCQgWy6TpXXXLd9lMZfy.png

      BigGrizzly @biggrizzly CC BY-NC-SA
    • @simplicissimus
      Simplicissimus @simplicissimus 27/07/2026

      j’hallucine ;-)

      Simplicissimus @simplicissimus
    • @vanderling
      Vanderling @vanderling 27/07/2026

      Dr Seenthis | Spy vs Spy
      ▻https://www.youtube.com/watch?v=mKgGQzMUSkE

      Vanderling @vanderling
    • @mfmb
      MFMB @mfmb 27/07/2026

      Comme je n’ai pas tout compris je demande. Des nouvelles personnes pourront encore s’inscrire à seenthis ?

      MFMB @mfmb
    • @biggrizzly
      BigGrizzly @biggrizzly CC BY-NC-SA 27/07/2026

      L’inscription est toujours ouverte, oui, bien sûr.

      Par exemple, un agent IA pourrait s’inscrire à seenthis et tout lire, s’il le souhaitait, s’il était capable de passer le barrage d’anubis et s’il était en mesure d’avoir un user-agent d’un navigateur standard.

      BigGrizzly @biggrizzly CC BY-NC-SA
    • @mfmb
      MFMB @mfmb 27/07/2026

      Si seenthis n’existe plus comment s’inscrire ? J’ai tapé seenthis et j’arrive à des trucs improbables comme
      ▻https://seenthis.co
      Je ne trouve plus LE seenthis

      MFMB @mfmb
    • @biggrizzly
      BigGrizzly @biggrizzly CC BY-NC-SA 27/07/2026

      Tu publies sur SeenThis, c’est que tu le trouves encore ? :-))

      Et si les humains en parlent entre eux, n’est-ce pas préférable à être trouvé par un moteur de recherche cybernétique possédé par une méta-corporation malfaisante ? C’est une question ouverte, qui mérite débat. Alors débattez ! ;-)

      BigGrizzly @biggrizzly CC BY-NC-SA
    • @vanderling
      Vanderling @vanderling 27/07/2026

      Entendu ce matin dans cet épisode sur france-cul’
      ▻https://www.radiofrance.fr/franceculture/podcasts/ils-ont-change-le-monde/1991-quand-le-web-devient-accessible-9206848
      au début de l’internet, les gougnafiers du web étaient surnommés « les vendeurs de canigou ». y’en a eus ici mais comme personne n’était intéressé par leurs croquettes, ils sont allés les vendre ailleurs.

      Vanderling @vanderling
    • @mfmb
      MFMB @mfmb 27/07/2026
      @biggrizzly

      @biggrizzly je retrouve seenthis qui est dans ma barre des taches certes mais plus à partir de mon téléphone.

      MFMB @mfmb
    • @biggrizzly
      BigGrizzly @biggrizzly CC BY-NC-SA 27/07/2026

      Y-a qu’à cliquer sur ►https://seenthis.net sur le téléphone pourtant ?

      Va falloir malgré tout faire le nécessaire pour laisser les moteurs indexer quelques pages du site ? C’est une idée ça...

      BigGrizzly @biggrizzly CC BY-NC-SA
    • @mfmb
      MFMB @mfmb 27/07/2026
      @biggrizzly

      @biggrizzly oui j’arrive avec le téléphone.Merci désolée pour les interruptions.

      MFMB @mfmb
    • @touti
      vide @touti 28/07/2026
      @arno

      Oui voila, bonne idée, on laisse des pages de présentation dont lq page de login et cette conversation ? Info complètemet fausse d’ailleurs, si @arno ne doit pas googler un acteur c’est parce que les batiments de google risquent d’être immédiatement recouverts d’un épais nuage de fientes de goëlands.

      vide @touti
    • @klaus
      klaus++ @klaus 28/07/2026

      Pages index.html pages de présentation du projet et sitemap statiques ouverts à tous et fermeture complète du contenu dynamique pour les robots/scraper etc.
      J’aimerais apprendre comment configurer le machin. Grand merci !

      #vie_privée

      klaus++ @klaus
    • @biggrizzly
      BigGrizzly @biggrizzly CC BY-NC-SA 28/07/2026

      Une proposition...

      Pages autorisées à tous :

      – ►https://seenthis.net > cette page contient les derniers messages publiés
      – ►https://seenthis.net/francais/article/c-est-quoi-seenthis
      – ►https://seenthis.net/francais/article/le-minimum-%C3%A0-savoir
      – ►https://seenthis.net/francais/article/automatismes-et-aspects-semantiques
      – ►https://seenthis.net/francais/article/moteur-de-recherche

      Pages interdites à toute navigation non-identifiée et à tous les bots (robots.txt + analyse du user-agent)

      – ►https://seenthis.net/all
      – ►https://seenthis.net/people
      – ►https://seenthis.net/messages
      – ▻https://seenthis.net/tag
      – ►https://seenthis.net/recherche

      Voyez-vous d’autres pages dont il faudrait discuter le traitement ?

      A propos du fichier sitemap.xml, faut-il le laisser en l’état ?

      A propos des flux RSS (urls */feed), elles sont toutes passées sous Anubis, bloquant l’essentiel des bots les consommant à longueur de temps.

      Pour rappel, les trois niveaux de protection :

      – protection Anubis, qui impose au navigateur une preuve de travail calculatoire, peu importe qui se présente

      – protection sur le user-agent (l’identité du navigateur), où on renvoie une erreur 429 dès que le user-agent contient certains mots clefs (comme les 3 lettres « bot »). J’ai inclus un « friendly bot » récemment, pour permettre aux instances Mastodon de venir lire les pages quand un lien vers SeenThis est posté sur Mastodon.

      – protection de la recherche, qui n’est autorisée qu’aux comptes identifiés.

      Tout cela n’est pas trivial à implémenter, mais c’est déjà une sorte de petit cahier des charges. N’hésitez pas à le compléter.

      BigGrizzly @biggrizzly CC BY-NC-SA
    • @mammut
      mammut @mammut 28/07/2026
      @klaus @touti @biggrizzly

      Pages index.html pages de présentation du projet et sitemap statiques ouverts à tous et fermeture complète du contenu dynamique pour les robots/scraper etc

      +1 @klaus
      +1000 @touti pour la trombe de fiente de goéland :))

      edit : +1 et merci @biggrizzly pour la proposition de solution

      mammut @mammut
    • @vanderling
      Vanderling @vanderling 28/07/2026
      @biggrizzly @odilon

      Une petite annonce de @biggrizzly il y a quatre mois suite à l’attaque des robots de l’enfer. ▻https://seenthis.net/messages/1166740
      et le tag #seenthis_outils établis par « l’intempestive » avant son départ et la suppression de tous ses seens et commentaires. Aude Vidal a aussi supprimé son compte et a fait effacer toutes ses traces. @odilon a disparue mais ses posts son toujours là. Inch’Allah.
      ►https://seenthis.net/tag/seenthis_outils

      Vanderling @vanderling
    • @klaus
      klaus++ @klaus 28/07/2026

      Dommage.
      Pas grave.
      À chacun/e sa paranoïa ;-)

      #intérêt_publique #journalisme #communication #histoire

      klaus++ @klaus
    • @touti
      vide @touti 28/07/2026
      @biggrizzly @mammut

      Impeccable ta liste @biggrizzly ++
      uhu @mammut marre des fakes des IA, rétablissons la vérité !

      Par contre, comme on est déjà dans un entre-soi certain, peut-être avoir un encart qui renvoie sur un texte pour expliquer et donner envie de nous rejoindre sur cette nouvelle politique seenthis ?

      vide @touti
    • @arno
      ARNO* @arno ART LIBRE 28/07/2026
      @nidal

      La difficulté de virer totalement les moteurs de recherche, c’est que ça revient à considérer Seenthis uniquement comme un réseau social. Or c’est aussi un outil de blog.

      Billets de blog qui du coup disparaissent des interwebz dès qu’on sort de Seenthis.

      Il m’est arrivé en début d’année de retomber sur un billet de @nidal suivi d’une discussion très constructive, via un moteur de recherche. Si on disparaît de Google, on perd ça qui me semble pourtant fondamental.

      Si c’était possible, il faudrait permettre de référencer toutes les pages /messages/1234, et donc un moyen d’y accéder.

      => Sinon pour être plus explicite : personnellement je conçois la protection du serveur uniquement dans l’optique de résister aux attaques de bots, qui rendent le site inutilisable. Par contre, le blocage contre la récupération des contenus par les IA, ça ne serait qu’un effet induit, mais pas un but au motif qu’on n’aime pas les LLM.

      ARNO* @arno ART LIBRE
    • @sombre
      Sombre @sombre CC BY-NC-SA 28/07/2026

      Bah, j’ai mis ce post en « épingle » sur mon compte BS :
      ▻https://bsky.app/profile/sombre-hermano.bsky.social/post/3ljmisjn7qc2c
      (avec le bouton <ALT> qui va bien avec l’image.

      Sinon le « Chat Mistral » m’a renvoyé quelques réponses sur une requête genre « que peux-tu me dire à propos de la plateforme Seenthis ? »
      Même qu’il a réussi à me loger en tant que « compte actif » mais il reconnaît que les utilisateurs·rices bénéficient de « l’anonymat » le plus total ! ... Quel boulet ce chat !

      https://rigolotes.fr/img/normal/20200106/1M6/20200106.jpg

      Sombre @sombre CC BY-NC-SA
    • @rastapopoulos
      RastaPopoulos @rastapopoulos CC BY-NC 28/07/2026
      @arno

      J’allais dire un peu comme @arno en découvrant ce fil : on n’est pas sur whatsapp là, c’est quand même un site avec du vrai contenu public utile, et le fait qu’il ne soit plus trouvable dans les vrais moteurs utilisés par les vrais gens mais que dans notre entre-soi, c’est quand même problématique.

      RastaPopoulos @rastapopoulos CC BY-NC
    • @b_b
      b_b @b_b PUBLIC DOMAIN 28/07/2026
      @biggrizzly

      @biggrizzly je suis dispo pour en causer demain si tu veux, pour dégrossir... Puis, il faudrait caler une session vocale/visio avec toutes les personnes intéressées par la question.

      b_b @b_b PUBLIC DOMAIN
    • @odilon
      odilon @odilon CC BY-NC-ND 29/07/2026
      @vanderling

      @vanderling coucou :) Pas totalement disparue, je garde un œil sur seenthis (seenthis c’est bien) mais je n’alimente plus depuis que je passe beaucoup beaucoup beaucoup moins de temps sur écran. Plus généralement je ne contribue plus aux réseaux sociaux, à part insta sur lequel je me mets quelques créa mais ici tout le monde s’en fout :) Je n’ai donc pas fermé mon compte ici et je laisse ce que j’y ai publié (sauf si ça dérange). Vas savoir, peut-être qu’un jour je reprendrai du service ! Bel été à toustes (et merci pour cette petite pensée pour moi).

      odilon @odilon CC BY-NC-ND
    • @sombre
      Sombre @sombre CC BY-NC-SA 30/07/2026
      @odilon

      Hello @odilon ! Content d’avoir de tes nouvelles. Je suis toujours ici et un peu moins ailleurs car c’est somme toute très chronophage tous ces réseaux. De plus, de nombreux soucis à gérer du côté de mes proches, problèmes de santé principalement. Donc je poste moins souvent ici. Bonne « route » à toi et protège-toi des « cramicules ». Personnellement, je fais régulièrement des crises de solastalgie mais je compte bien sur nos « bons maîtres » pour gérer mon « éco-anxiété ».

      https://pixelfed.fr/storage/m/_v2/791632196803044117/4c90d8e69-c5a1c2/7aSMxAFAEA4p/wpmkE3hzmmhnjwavSvpSTWaBvfkSGg3XaZxVRXK1.webp

      Source : ▻https://bsky.app/profile/zgur.eurosky.social/post/3mrhoexu4bs2c

      puisque, apparemment, ce serait un problème de « santé mentale »

      https://pixelfed.fr/storage/m/_v2/791632196803044117/4c90d8e69-c5a1c2/IJaSTVwbWdgT/pibmynF5OK9dAoZCsGQivT2XnTogtxWeI1sqS6EY.webp https://pixelfed.fr/storage/m/_v2/791632196803044117/4c90d8e69-c5a1c2/BGdY7ndwNheA/jrMbOvhB8T7Zgy9LqsDFLp9wpW8IbE53MFCqM3hf.webp

      Sombre @sombre CC BY-NC-SA
    • @sombre
      Sombre @sombre CC BY-NC-SA 30/07/2026
      @klaus

      Déso pour le trollage @klaus et les autres participant·es ...

      Sombre @sombre CC BY-NC-SA
    • @biggrizzly
      BigGrizzly @biggrizzly CC BY-NC-SA 30/07/2026
      @b_b

      Ma réflexion sur l’ouverture ou pas du site aux bots est contradictoire.

      1. J’estime que nous sommes à un point où nous ne devrions pas donner quoi que ce soit à ces bots, du fait que leurs propriétaires ne nous veulent pas du bien. C’est une position politique d’autodéfense.

      2. Techniquement, je sais que s’ils souhaitent venir consommer nos contenus, ils le peuvent, c’est moins facile, mais c’est sans espoir, nous ne pouvons pas totalement protéger nos contenus si nous ne voulons pas rendre le site inutilisable.

      3. Nous n’avons rien à cacher, certes. Mais tout de même, si on pouvait éviter d’alimenter le Léviathan, ça serait mieux.

      4. Pourquoi devrait-on utiliser un moteur de recherche extérieur pour accéder aux contenus de SeenThis ? Le souci est-il que le moteur de recherche actuel est imparfait ?

      5. Question plus générale. Pourquoi considère-t-on naturel de faire appel à des moteurs de recherche extérieurs, qui sont en quelque sorte un service public d’accès à l’information ? Ne devrait-on pas disposer chacun de son araignée personnelle qui parcourt le web afin d’alimenter notre index personnel de l’Internet ?... Il y a un souci dans la délégation actuelle à des moteurs de recherche qui peuvent décider d’invisibiliser certains contenus, ou au contraire d’en pousser d’autres. Et il n’y a aucun projet politique visant à assurer une neutralité minimaliste à ces outils (rien que définir cette neutralité est casse gueule, mais je pose la question, c’est déjà un premier pas).

      Conclusion d’étape :

      Il y a deux camps :

      – celui de l’ouverture pour exister sur les Internet ;
      – celui de la fermeture complète, parce que marre.

      Comment on départage ? Comment on trouve un équilibre ?

      Pour la technique, merci @b_b pour ta disponibilité. Dès qu’on aura déterminé une direction, on tâchera de faire les choses dans l’ordre, avec un ou plusieurs tickets et tout et tout.

      BigGrizzly @biggrizzly CC BY-NC-SA
    • @biggrizzly
      BigGrizzly @biggrizzly CC BY-NC-SA 30/07/2026
      @odilon

      J’ajoute que coucou @odilon, content de te lire :-)

      BigGrizzly @biggrizzly CC BY-NC-SA
    • @vanderling
      Vanderling @vanderling 30/07/2026
      @odilon @klaus

      Pareil @odilon content de te lire et peut être à bientôt par ici. Pas sur Insta ou Meta, je boycott. je retombe parfois sur tes anciens seens, comme celui-ci ►https://seenthis.net/messages/448947 et bien d’autres qui donne matière à réflexion. Tout comme ce seen de référence de @klaus avec ses commentaires. Vous je ne sais pas mais moi je suis toujours aussi con. Un peu moins quand je regarde seenthis.

      Vanderling @vanderling
    • @touti
      vide @touti 30/07/2026
      @sombre

      @sombre excellent ! #couic

      vide @touti
    • @arno
      ARNO* @arno ART LIBRE 30/07/2026
      @biggrizzly

      @biggrizzly - Note que tu es passé de la mise en place d’une protection contre les DOS causés par le passage de bots sauvage (et c’était devenu totalement indispensable) à une fermeture parce que tu n’aimes pas qu’on nous prenne le contenu. Ça n’est pas du tout pareil, et je ne crois pas que ça ait été discuté en ces termes.

      – L’internet a très rapidement été dépendant des moteurs de recherche pour permettre aux gens de découvrir les contenus. Yahoo, Google. Et ça n’a jamais été des bienfaiteurs de l’humanité, mais des acteurs ultra-capitalistes, avec un rapport très paradoxal à l’accès et à la promotion de l’expression publique pour le plus grand nombre. De la même façon, les gros réseaux sociaux (tous horribles) ont servi, et servent encore parfois, à faire connaître des contenus hors de l’industrie des médias et de la pub.

      – J’ai cru comprendre que notre moteur de recherche exige – justement dans le cadre de la protection antibots – d’être un membre connecté de Seenthis. Donc pour le coup, notre moteur ne remplace pas, et de loin, un moteur externe.

      – Encore une fois : Seenthis a été conçu dans une optique de micro-blogging, pas un simple réseau social. Pour moi le fait de s’insérer le plus largement possible dans les différents outils du Web, c’est vital. Notamment le référencement, les agrégateurs de contenu, les réseaux sociaux…

      – Et par ailleurs je ne sais pas à quel point on doit se lancer dans des considérations sur « donner nos contenus ». Une large partie de notre vision du Web (et de nos usages pratiques) dépend de l’accès à des contenus fermés/protégés, en utilisant des outils de scrapping de contenus tels qu’archive.ph. Et les sites qui, justement, bloquent les accès à de tels outils d’aspiration de leurs contenus, hé ben c’est pas trop notre truc.

      ARNO* @arno ART LIBRE
    • @colporteur
      colporteur @colporteur CC BY-NC-SA 30/07/2026
      @arno

      Je ne me sens guère légitime pour critiquer le fonctionnement du moteur de recherche de seenthis, ne serait-ce que parce que je crois mal l’utiliser, mais, simplement, je signale qu’il m’arrive d’en employer un autre pour retrouver un contenu présent ici.

      édit suis plutôt de l’avis exprimé par @arno.
      d’autant qu’il est décisif de garder une ouverture (de la visibilité) alors que la tendance parait être aux seenthissien.nes qui s’absentent davantage qu’aux arrivant.es qui postent.

      colporteur @colporteur CC BY-NC-SA
    • @simplicissimus
      Simplicissimus @simplicissimus 30/07/2026
      @arno

      oui, plutôt d’accord avec la position d’@arno …

      le pb, c’est que ledit moteur de recherche a pour stratégie déclarée d’invibiliser ses sources ou, au minimum, de ne pas faciliter (euphémisme…) l’accès auxdites sources. Cf. ci-dessus, la recherche sur la Mongolie, tout est fait pour rester dans l’environnement de l’IA et continuer ou affiner sa recherche par une nouvelle requête (prompt)

      Simplicissimus @simplicissimus
    • @fonkisifou
      Fonkisifou @fonkisifou CC BY-NC-SA 30/07/2026

      Je fais plein de pubs pour seenthis et rezo (mais tout le monde s’en fout, je crois que je ne vous ai jamais ramené personne, snif).

      Sur les moteurs on vous trouve à peine (je sais plus comment j’étais tombé sur rezo.net mais j’étais à la limite du désespoir avant de tomber dessus).

      Si on revient aux sources :

      Mars 2009, nous sommes toujours là. Avec la même envie de vous faire partager nos lectures

      ►https://rezo.net/pourquoi

      J’ai toujours bénéficié de « vos lectures » et ça m’a énormément apporté.
      Ce serait dommage que d’autres acharnés et avides de comprendre le monde puissent pas vous trouver à cause des IA.
      (pour répondre à la question 4)

      Ca fait longtemps que je surveille les alternatives aux moteurs de recherche existant.
      Il est dit ici qu’il faut des moyens considérables pour avoir quelque chose d’efficace. Ca explique pourquoi il n’y en a que 4 (▻https://mamot.fr/@bendineliot/102507200895682574 ) et que les alternatives ne décollent pas.
      (question 5)

      Tout cela étant dit, politiquement c’est dur de ne pas être d’accord avec les points 1 2 et 3.

      Mais j’ai l’impression que l’IA nous dépasse tellement que c’est comme tenter de vivre sans électrons provenant du nucléaire (mon obsession, argh) en France.

      Fonkisifou @fonkisifou CC BY-NC-SA
    • @rastapopoulos
      RastaPopoulos @rastapopoulos CC BY-NC 30/07/2026

      Pour répondre à 4 (mais ça répond à 1 2 3 du coup) :
      – le moteur interne ne sert que pour les déjà-utilisateurices
      – le but de seenthis est bien de publier des contenus utiles à toutes, pas que aux gens qui ont déjà un compte seenthis
      – même si le moteur interne était ouvert à toutes : ça n’aurait quasiment aucun intérêt puisque pour ça il faut déjà connaitre le site… or c’est justement le fait que les contenus utiles soient indexables et indexés ailleurs qui fait que des inconnus peuvent les trouver

      RastaPopoulos @rastapopoulos CC BY-NC
    • @biggrizzly
      BigGrizzly @biggrizzly CC BY-NC-SA 30/07/2026

      A propos du fait de trouver SeenThis au moyen d’un moteur de recherche, je n’ai sans doute pas été assez complet dans mes prémisses.

      Le chemin que prend la fonctionnalité « moteur de recherche » chez les fournisseurs de cet oligopole est que tu ne trouveras plus de références aux ressources qui répondent à tes questions, mais uniquement des réponses à tes questions rédigées depuis les ressources que tu recherches.

      Si on est pessimiste, on conclue que même si SeenThis est indexé, jamais les portails de recherche ne te diront qu’ils ont utilisé son contenu pour répondre à la question posée. De mon côté, j’estime que c’est le chemin qui est en train d’être pris. Mais je sais que je suis exagérément pessimiste, et qu’il va rester possible d’accéder à des moteurs de recherche traditionnels.

      Ceci dit. Je n’ai pas découvert SeenThis par un moteur de recherche. On m’a dit qu’il existait, et je m’y suis inscrit et j’y suis resté. Je continue d’y alimenter mon compte. Alors même que j’apprécie aussi Mastodon et que je continue régulièrement de me demander pourquoi je n’ouvre pas une instance autonome de Mastodon... (je le sais, il faudrait la maintenir, et j’ai déjà bien assez de choses à maintenir... et il faudrait la modérer, et je déteste modérer et fréquenter les gens qui s’amusent avec les modérateurs... et surtout, il faudrait éviter de se faire bloquer par les autres instances, et quoi que très diplomate, j’ai quelques doutes quant à ce que l’instance reste connectée avec le reste du monde bien longtemps, à cause de la modération en particulier).

      J’ai essayé régulièrement, de retrouver certains de mes billets techniques au moyen des moteurs de recherche internes et externes, et je dois dire que j’ai toujours eu du mal pour les retrouver !

      Ce que je veux dire, c’est que je ne crois pas qu’on découvre SeenThis par les moteurs de recherche. Par contre, comme pour un site vitrine, on en vérifie l’existence et la notoriété, assurément.

      BigGrizzly @biggrizzly CC BY-NC-SA
    • @colporteur
      colporteur @colporteur CC BY-NC-SA 30/07/2026
      @simplicissimus

      Je n’ai pas non plus découvert seenthis par un moteur mais il m’est arrivé de chercher des seen en utilisant un moteur externe (faute de trouver).
      Là, comme le dit @simplicissimus, il semble que cela ne fonctionne plus (si par exemple je tape « chômeurs seenthis » y a R a part l’accès à un résumé de ce que seenthis relaie, qui est catastrophique).

      colporteur @colporteur CC BY-NC-SA
    • @b_b
      b_b @b_b PUBLIC DOMAIN 30/07/2026

      HS : pour les personnes qui galèrent pour retrouver un de leurs post ou un de ceux qu’elles ont étoilés, je rappelle l’existence de ce plugin firefox dont je suis le seul utilisateur à ce jour ^^

      ►https://addons.mozilla.org/fr/firefox/addon/seenthis-search

      b_b @b_b PUBLIC DOMAIN
    • @sombre
      Sombre @sombre CC BY-NC-SA 30/07/2026
      @b_b

      @b_b : c’est amusant car cet après midi, je suis tombé sur cette page en suivant justement un moteur de recherche, en l’occurence Zotop de chez Zaclys.

      ▻https://zotop.fr

      Et il y avait quelques résultats qui matchaient avec seenthis.net dont celui-ci :

      https://pixelfed.fr/storage/m/_v2/791632196803044117/4c90d8e69-c5a1c2/wPC8KUrsY789/0pkxyXraz8YBUWjXsepmz8vSKmCSeP7TgbCRBhVD.png

      Sombre @sombre CC BY-NC-SA
    • @roinu
      RoiNu @roinu 31/07/2026

      Je ne me sens pas très légitime pour intervenir ici parce que je ne suis pas développeur informatique, à peine bidouilleur, et pas celui qui a le plus d’ancienneté. D’ailleurs je ne vais pas prendre position faute d’avoir une opinion et encore moins une solution sur ce serpent diabolique qui se mord la queue.

      Mais je veux quand même en profiter pour dire deux trois choses :

      Premièrement une grande gratitude pour toutes celles et ceux qui ont bâti ce truc seenthis improbable et le maintiennent.

      Depuis quelques semaines je prends un peu plus conscience de l’ampleur de l’impasse dans laquelle se trouvent plein d’organisations avec le pillage par l’IA et le tournant historique des moteurs de recherche. Le fait que des créateurs de contenu (et souvent ce sont les meilleurs) se retirent de la toile me terrifie. C’est une bibliothèque qui brûle (et nous regardons ailleurs ;-)

      Et il y a tous ceux qui ont un modèle économique qui s’effondre. Dans le tas, il y a des gentils : petits e-commerçants, petits producteurs de contenus indépendants, médias alternatifs, artistes... Que restera-t-il dans seulement un an ?
      Je comprends mieux maintenant l’atrophie totale vers laquelle le nouveau paradigme mène internet.

      Finalement cela produit une sensation de fin d’un monde très perturbant. Un monde dans lequel je savais bien nager. D’une certaine manière, je faisais partie des winers de ce monde. Rien que cette prise de conscience me donne à réfléchir.
      Internet était riche, il s’appauvrit. Dans seulement un an, je pense qu’on pourra parler de méga enshittification, ou d’enshittification totale ou finale.

      Quand le supermarché ne vend plus que de la merde, on se demande si ce n’était pas lui qui était de la merde depuis tout ce temps malgré son sympathique rayon de bières artisanales locales... et il est temps d’aller au marché de producteurs et à l’épicerie autogérée.

      On arrête tout, on réfléchit, et c’est pas triste. Réduire beaucoup beaucoup beaucoup les écrans comme Odilon, c’est l’avenir, surtout si ça se remplace par des trucs bien.

      Désolé, tout ça n’aidera même pas à prendre une décision. C’est juste un partage d’état d’âme.

      RoiNu @roinu
    • @biggrizzly
      BigGrizzly @biggrizzly CC BY-NC-SA 31/07/2026

      La discussion n’est pas technique, à mon sens. Elle est sur les principes : dans quelle mesure où ouvre le contenu aux robots et aux milliardaires, c’est à dire dans quelle mesure où on offre des ressources matérielles et intellectuelles, gratuitement, et avec un espoir de retour proche de zéro, voire négatif.

      Jusqu’alors, la promesse de Google, c’était que Google allait dire qu’on existe, et nous on allait dire que c’est génial, Google ils aident à ce qu’on existe. Mais comme chez Google et chez les autres, ils sont en situation d’oligopole, ils ont décidé que le service rendu, dire qu’on existe, ce n’était pas assez rémunéré.

      Alors. Donc. Voilà. Tout le monde peut participer à la discussion. :-)

      Il y a aussi le sujet des flux RSS. Je ne pensais pas qu’un jour j’en arriverais à dire qu’ils sont nocifs. Mais sur SeenThis, leur nombre, et leur consommation par des bots avides, est à mon avis une des explications au fait qu’on ait des difficultés sur certains traitements, lorsqu’il y a de la montée en charge. Et ça pose donc la question de la pertinence d’avoir de laisser ces flux en accès libre (sans Anubis). Mais c’est un autre débat. Mais c’est un débat aussi.

      BigGrizzly @biggrizzly CC BY-NC-SA
    • @b_b
      b_b @b_b PUBLIC DOMAIN 4/08/2026
      @biggrizzly

      @biggrizzly une piste alternative à anubis qui remonte souvent ces temps-ci est iocaine ▻https://iocaine.madhouse-project.org

      - Serve identifiable bots garbage, with poisoned urls
      – Anything that hits a poisoned url gets 12 hours on the firewall.

      source ▻https://mastodon.roflcopter.fr/@algernon@come-from.mad-scientist.club/117036039914052825

      À étudier...

      b_b @b_b PUBLIC DOMAIN
    • @biggrizzly
      BigGrizzly @biggrizzly CC BY-NC-SA 6/08/2026

      C’est drôle, la dernière mise à jour de SPIP sur SeenThis a désactivé un élément de protection que j’avais placé à la sauvage dans le code de SPIP. Ce qui fait que plus aucun bot ne se fait bloquer du tout.

      Le résultat est en quelque sorte édifiant.

      Tu veux avoir le droit d’exister sur Internet ? Y compris en activant Anubis. Alors accepte de devoir assumer un trafic multiplié par 10.

      C’est en quelque sorte le tribut au dieu de l’Internet que tout un chacun se doit de verser.

      https://pixelfed.zoo-logique.org/storage/m/_v2/493151427756716033/9a26d276d-23d3a8/QtKhhPDYVUnP/YdqPrr1OdJ3B3zMBSc0L7g4HFTYjYFe0vsxVGkSo.png

      BigGrizzly @biggrizzly CC BY-NC-SA
    • @biggrizzly
      BigGrizzly @biggrizzly CC BY-NC-SA 6/08/2026

      Vous aurez noté que certains posts créés par RSS ne se créent plus convenablement (par exemple XKCD du jour). Ceci expliquant donc cela.

      BigGrizzly @biggrizzly CC BY-NC-SA
    • @rastapopoulos
      RastaPopoulos @rastapopoulos CC BY-NC 6/08/2026

      Et donc ça c’est même avec Anubis… et c’était quoi le blocage ajouté en plus ?

      RastaPopoulos @rastapopoulos CC BY-NC
    • @biggrizzly
      BigGrizzly @biggrizzly CC BY-NC-SA 6/08/2026

      SPIP a une protection sur le load du serveur. De plus, cette protection ajoute un aléa. Quand le load est trop élevé, les bots reçoivent une erreur 429. Sur la machine SeenThis, il y a un paramètre (une jail) fail2ban qui bloque les IP qui génèrent des erreurs 429. Dans la version personnalisée à la sauvage de SPIP, il n’y a pas d’aléas à l’envoi de l’erreur 429, et le load est toujours trop élevé. Et donc, les IP des bots sont systématiquement bannies au bout de 2 tentatives.

      Le graph des requêtes avant Anubis a environ le même aspect en moins pire. C’est à dire qu’il y a une croissance du trafic. Je tâcherais de sortir les deux graphs la prochaine fois que j’allume le PC :-)

      BigGrizzly @biggrizzly CC BY-NC-SA
    • @b_b
      b_b @b_b PUBLIC DOMAIN 6/08/2026
      @biggrizzly

      Arf, désolé @biggrizzly je ne savais pas et ne pouvais pas le savoir puisque l’installation n’était pas en git. Maintenant que c’est le cas, je pourrai faire les prochaines mises à jour sans perdre tes modifs.

      PS : il serait peut-être intéressant d’ajouter un point d’entrée dans SPIP pour permettre ta modif de manière plus pérenne. On en cause la semaine prochaine si tu veux.

      b_b @b_b PUBLIC DOMAIN
    • @biggrizzly
      BigGrizzly @biggrizzly CC BY-NC-SA 9/08/2026

      C’est amusant de voir la différence de volume avant/après Anubis.

      L’analyse sur les IP est intéressante aussi. On voit que les chinois ne passent pas (encore) Anubis.

      Et on constate que Apple est très ouvert dans son comportement. Il n’a qu’un seul user-agent, mais qu’est-ce qu’il est gourmand !

      Avant Anubis :

      https://pixelfed.zoo-logique.org/storage/m/_v2/493151427756716033/9a26d276d-23d3a8/C7fcOGZx2vGR/rRGxLUUoe1T4YmDyOPiONJpZpd7KHRLjF0tblsvc.png https://pixelfed.zoo-logique.org/storage/m/_v2/493151427756716033/9a26d276d-23d3a8/u1yyNDnFDFJd/EjUfjMDxSfIZmgc3wZb6MeBFhFK5RRXhPnYMwFKn.png https://pixelfed.zoo-logique.org/storage/m/_v2/493151427756716033/9a26d276d-23d3a8/S7g4gymER2Qb/hk0saYaSYWGBlsKU1ZChdgzQbQwzzMdxFLIfdRCe.png

      Après Anubis :

      https://pixelfed.zoo-logique.org/storage/m/_v2/493151427756716033/9a26d276d-23d3a8/fotisJifJXLh/6iwRN1C3UXxNs9hnMBJQtmRJPUaaQsnItCWAnh3l.png https://pixelfed.zoo-logique.org/storage/m/_v2/493151427756716033/9a26d276d-23d3a8/ICGJOJN5nHS2/ohYOciDZsadvr7eg9FEdVKxADnrw3xRuD7M9KGOj.png https://pixelfed.zoo-logique.org/storage/m/_v2/493151427756716033/9a26d276d-23d3a8/3wAfLmSfPgXs/YRD9M9Q3UrXPxTtyWhI1QJjILJTcJwt7oU35risj.png

      Si, comme vous semblez le vouloir, il faut s’ouvrir à fond les ballons à tous les techbros-sauveurs-du-capitalisme de la planète, je dirais qu’il faut améliorer SeenThis dans les directions déjà mentionnées dix fois je crois :

      1. Améliorer le fonctionnement du CRON interne, pour qu’il ne s’exécute pour de vrai qu’une seule fois par minute.

      2. Améliorer le fonctionnement de la création des posts par RSS, pour qu’ils ne se retrouvent pas bloqués par la surcharge du serveur, liée aux bots.

      3. Améliorer certaines requêtes très lentes (calcul des fils avec blocages).

      On pourra aussi sans doute, aussi, un de ces jours, réfléchir à la façon de construire les flux RSS sans qu’ils n’engendrent eux même des soucis de concurrence sur la base de données. Parce que si on ne les protège pas par Anubis, ils sont consommés à un rythme infernal.

      BigGrizzly @biggrizzly CC BY-NC-SA
    • @rastapopoulos
      RastaPopoulos @rastapopoulos CC BY-NC 9/08/2026

      1. Améliorer le fonctionnement du CRON interne, pour qu’il ne s’exécute pour de vrai qu’une seule fois par minute.

      Est-ce souhaitable, car ça veut dire seulement pile 1440 fois par jour, alors que s’il y a beaucoup de tâches de fond à faire, les jobs de SPIP se lancent « quand il y a un truc à faire » dès lors qu’il y a un hit PHP par quelqu’un (humain ou robot qui passe les portes).

      Quand il n’y a aucune tâche à faire à un instant T… ce cron n’est censé rien faire non ? Donc ça fait quoi comme surcharge, ça lance quoi de trop que ça ne devrait pas lancer ? Juste la « recherche de tâches à faire » (qui est vide si plus rien en stock) est déjà trop gourmande ?

      2. Améliorer le fonctionnement de la création des posts par RSS, pour qu’ils ne se retrouvent pas bloqués par la surcharge du serveur, liée aux bots.

      Ça se fait justement… dans les jobs/cron, donc si ça se lance plein de fois : ça fait avancer plus souvent l’importation. Là encore le diagnostique n’est super clair : c’est quoi qui bloque quoi ? Et de quelle manière ça bloque plus l’import de seen que les créations manuels par un humain dans l’interface ?

      3. Améliorer certaines requêtes très lentes (calcul des fils avec blocages).

      C’est le seul point pour lequel sans plus d’infos je pourrai avoir une intuition dont on avait parlé ya 5 ans ou plus déjà : si on s’assure d’indexer assez des bonnes informations nécessaires dans Manticore, alors l’ensemble des fils du site pourraient être générés avec, et non pas juste la page de recherche. Au moins les boucles principales de sélection. Càd : toutes les listes de chaque auteurices, tous les RSS, et les accueils de chaque personne et des anonymes. Les boucles/requêtes de Manticore sont beaucoup, beaucoup, plus rapides que les requêtes MySQL à priori.

      RastaPopoulos @rastapopoulos CC BY-NC
    • @biggrizzly
      BigGrizzly @biggrizzly CC BY-NC-SA 9/08/2026

      Autre graphique : nombre de requêtes qui durent plus de 5 secondes sur les 14 derniers jours.

      Plus il y a de monde qui consulte le site, plus il y a de pages qui se retrouvent bloquées.

      Il y a un souci de concurrence dans le code de seenthis, souci à corriger d’une façon ou d’une autre ; j’ignore où il se situe, et je ne fais en l’état que des propositions de pistes de recherche.

      https://pixelfed.zoo-logique.org/storage/m/_v2/493151427756716033/9a26d276d-23d3a8/Uh3HGVWEdqq0/RoVVzfWwGCCGNYEqLez92V9gjosVejunYaWlyWUb.png

      J’évoque le CRON car parfois, dans le passé, avant Anubis, j’ai constaté qu’il s’appelait de très nombreuses fois dans des intervalles de temps très courts, sans aucune raison valable. Du fait d’Anubis, je ne vois pas de cas comparable en ce moment. Je note des pics, avec des appels concentrés sur une même seconde.

      Ici, on voit qu’à 09h09 le 7 août, on a une vingtaine d’appels. Je soupçonne des soucis de ce point de vue là, s’il manque une vraie section critique. Ceci dit, ces appels, présentement, ont tous duré moins de 100ms.

      https://pixelfed.zoo-logique.org/storage/m/_v2/493151427756716033/9a26d276d-23d3a8/aOyaX8K5a5mw/jj4ghbjzSR60gRvZo1MYJDLQvXAjXPBZ1zURn5GF.png

      Par principe, je désapprouve les webcrons. Quand on a besoin de faire exécuter qq chose régulièrement, si on en a la possibilité, je trouve un vrai gestionnaire de tâches planifiées préférable. Mais si le CRON de SPIP est conforme tant mieux. Il n’empêche qu’il lui arrive de s’emballer, à mon sens, de ce que je vois dans les journaux apache.

      Concernant les posts créés par RSS, dès qu’il y a de la concurrence, ils apparaissent sans contenu dans les fils. Pendant toute la durée de bannissement des bots, les posts RSS se sont créés sans difficultés. Depuis que c’est rouvert, on a à nouveau de tels soucis. Ceci dit ces soucis se résolvent d’eux même quand les posts passent en page 2. C’est apparemment un souci de mise en cache du post, quand le post est créé, et qu’en même temps la page d’accueil est réclamée.

      BigGrizzly @biggrizzly CC BY-NC-SA
    • @biggrizzly
      BigGrizzly @biggrizzly CC BY-NC-SA 9/08/2026

      L’envoi de mon commentaire a pris plus de 8 secondes. Ce n’est pas normal. Et ça n’a lieu qu’en situation de forte charge.

      (bis, ce second commentaire aussi, plus de 8 secondes)

      (ter, la validation de la modification du commentaire, plus de 20 secondes)

      Confirmation par les journaux : mes 4 validations successives.

      Pas un souci de concurrence pour le coup, y-a pas de surcharge présentement. Ça doit être lié à la structure de ce post plein de commentaires ?

      https://pixelfed.zoo-logique.org/storage/m/_v2/493151427756716033/9a26d276d-23d3a8/N4eXlpTY75JX/DsfilkSOpKdUZSvPhfytxoSrP1JnkZ7liNHOEDKO.png

      BigGrizzly @biggrizzly CC BY-NC-SA
    • @biggrizzly
      BigGrizzly @biggrizzly CC BY-NC-SA 9/08/2026

      C’est chouette, je tombe juste sur le souci de création de post depuis un RSS. Sur mon fil, ça affiche ça :

      https://pixelfed.zoo-logique.org/storage/m/_v2/493151427756716033/9a26d276d-23d3a8/BgTxkmyVW5Cp/qCVLtCbQGPcgra8zmGoJJtOP10zBgXofVjIvOacU.png

      BigGrizzly @biggrizzly CC BY-NC-SA
    • @inadvertance
      inadvertance @inadvertance PUBLIC DOMAIN 10/08/2026

      99% of My Website Traffic Is Bots

      ▻https://patronview.com/news/99-percent-of-my-website-traffic-is-bots

      Les observations et contre-mesures d’un autre galérien, lui avec Cloudflare.

      https://i.ibb.co/35Jm3sQw/image.png

      inadvertance @inadvertance PUBLIC DOMAIN
    • @b_b
      b_b @b_b PUBLIC DOMAIN 11/08/2026
      @biggrizzly

      @biggrizzly pour info, je viens de mettre à jour #seenthis en SPIP 4.4.18. J’ai vérifié avant de le faire, et il n’y avait pas de modifications locales. Je reviendrais plus tard dans ce fil pour discuter des points que tu listes plus haut.

      b_b @b_b PUBLIC DOMAIN
    • @biggrizzly
      BigGrizzly @biggrizzly CC BY-NC-SA 12/08/2026

      Juste pour discuter.

      On vient de faire un point sur la journalisation de nos serveurs web, qui permet de visualiser les stats comme dans mes commentaires précédents.

      On confirme le avant/après blocage des bots

      – Avant Anubis, trafic sans bots = 1, trafic avec bots = 6
      – Après Anubis, trafic sans bots = 1, trafic avec bots = 10

      On a multiplié le trafic par 10 depuis que les bots sont libres de consommer SeenThis.

      On ne stocke que 3 mois de journaux pour SeenThis. Mais un trafic multiplié par 10, plus le trafic supplémentaire impliqué par Anubis, ça augmente l’espace nécessaire pour les journaux.

      On doit aussi gérer d’autres absurdités des bots sur d’autres serveurs web. Par exemple le cas de ce bot meta qui consomme en continu les photos d’un blog qui a commencé sa vie au début du siècle. Des millions de lecture de photos lues et relues, toujours les mêmes, consommées en continu. On a bloqué meta globalement sur ce serveur mutualisé. C’est tellement absurde.

      Malgré nos mesures de nettoyage et de blocage, c’est une croissance du trafic qu’on constate, alors même que globalement, les moteurs de recherche, c’est de notoriété publique, ne renvoient plus de visiteurs.

      Bref, on ajoute ce matin 100Go de plus sur le serveur dédié aux journaux web, ça fait un petit serveur à 500Go d’espace total. Pour voir venir.

      Mon opinion est de plus en plus ferme. Les bots ne servent à rien d’autres qu’à nous imposer de rajouter des ressources sans aucun retour en échange. Le futur de la communication entre humains ne passe pas par les moteurs de recherche mais par les réseaux sociaux distribués. Peut-être devrions-nous tâcher de construire des moteurs de recherche distribués (ça n’existe pas en l’état, consommer des moteurs commerciaux ça n’est pas du moteur de recherche distribué).

      BigGrizzly @biggrizzly CC BY-NC-SA
    • @biggrizzly
      BigGrizzly @biggrizzly CC BY-NC-SA 12/08/2026

      StupidAntibot [Wiki de sebsauvage.net]
      ►https://sebsauvage.net/wiki/doku.php?id=stupidantibot

      (...)

      Alors bien sûr cela va aussi bloquer les bots indexeurs des moteurs de recherche, mais de toute manière Google n’est déjà plus capable d’afficher des résultats pertinents et il n’amène plus de trafic.

      Mon crédo : Écrire pour les humains, pas pour les robots. Donc je m’en fous totalement que tous les robots soient bloqués.

      (...)

      De l’eau au moulin :-)

      BigGrizzly @biggrizzly CC BY-NC-SA
    • @b_b
      b_b @b_b PUBLIC DOMAIN 14/08/2026

      Réponses un peu tardives...

      1. Améliorer le fonctionnement du CRON interne, pour qu’il ne s’exécute pour de vrai qu’une seule fois par minute.

      Je croyais que la solution que je proposais dans ▻https://github.com/seenthis/hebergement/issues/29#issuecomment-4104042165 faisait le job, ça n’est pas le cas ?

      2. Améliorer le fonctionnement de la création des posts par RSS, pour qu’ils ne se retrouvent pas bloqués par la surcharge du serveur, liée aux bots.

      Ça mérite un ticket dans ▻https://git.spip.net/seenthis/importer-flux/-/work_items :)

      3. Améliorer certaines requêtes très lentes (calcul des fils avec blocages).

      Ça fait 10 ans qu’on a un ticket à ce sujet ▻https://git.spip.net/seenthis/squelettes/-/work_items/159 mais personne ne s’y jamais vraiment collé :\

      Le futur de la communication entre humains ne passe pas par les moteurs de recherche mais par les réseaux sociaux distribués.

      Avec le temps qui passe et le peu d’énergies/volontés à dispo pour maintenir seenthis, je pense parfois (souvent ?) qu’une instance masto (ou autre) dédiée aux membres de seenthis ferait très bien le job.

      b_b @b_b PUBLIC DOMAIN
    • @fonkisifou
      Fonkisifou @fonkisifou CC BY-NC-SA 15/08/2026
      @biggrizzly

      ▻https://framapiaf.org/@framasky/117098596543170343

      Coucou @biggrizzly 😘

      Fonkisifou @fonkisifou CC BY-NC-SA
    Écrire un commentaire
  • @biggrizzly
    BigGrizzly @biggrizzly CC BY-NC-SA 25/04/2024
    5
    @spip
    @sombre
    @colporteur
    @marielle
    @marcimat
    5

    Liste des 10 principaux user-agents dans les 1000 dernières lignes logs au moment de l’énième surcharge du jour : aucun humain

        369 Mozilla/5.0 (Linux; Android 6.0.1; Nexus 5X Build/MMB29P) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/122.0.6261.94 Mobile Safari/537.36 (compatible;  *GoogleOther* )
        246 Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible;  *ClaudeBot* /1.0; +claudebot@anthropic.com)
         92 Mozilla/5.0 (Linux; Android 6.0.1; Nexus 5X Build/MMB29P) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/122.0.6261.94 Mobile Safari/537.36 (compatible;  *Googlebot* /2.1; +http://www.google.com/bot.html)
         76 Mozilla/5.0 (Macintosh; Intel Mac OS X 10_10_1) AppleWebKit/600.2.5 (KHTML, like Gecko) Version/8.0.2 Safari/600.2.5 ( *Amazonbot* /0.1; +https://developer.amazon.com/support/amazonbot)
         47 Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible;  *GPTBot* /1.0; +https://openai.com/gptbot)
         35 SPIP-3.2.19 (https://www.spip.net)
         20 Mozilla/5.0 (Linux; Android 5.0) AppleWebKit/537.36 (KHTML, like Gecko) Mobile Safari/537.36 (compatible;  *Bytespider* ; spider-feedback@bytedance.com)
         19 Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible;  *bingbot* /2.0; +http://www.bing.com/bingbot.htm) Chrome/116.0.1938.76 Safari/537.36
         15 Mozilla/5.0 (compatible;  *AhrefsBot* /7.0; +http://ahrefs.com/robot/)
         13 Mozilla/5.0 (compatible;  *DataForSeoBot* /1.0; +https://dataforseo.com/dataforseo-bot)

    J’ai vérifié en allant voir les 10 suivantes. Pareil. Enfin. Mon user-agent caractéristique fini par apparaître à la 19ème ligne.

    BigGrizzly @biggrizzly CC BY-NC-SA
    • @biggrizzly
      BigGrizzly @biggrizzly CC BY-NC-SA 25/04/2024
      @seenthis

      @seenthis : l’un d’entre vous pourrait-il vérifier pourquoi le système de rejet par 503 des bots en fonction du load ne fonctionne pas ?

      BigGrizzly @biggrizzly CC BY-NC-SA
    • @biggrizzly
      BigGrizzly @biggrizzly CC BY-NC-SA 25/04/2024

      Toujours le même classement deux heures après. Ils sont tous en train de récupérer l’intégralité de SeenThis.

          359 Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; ClaudeBot/1.0; +claudebot@anthropic.com)
          104 Mozilla/5.0 (Macintosh; Intel Mac OS X 10_10_1) AppleWebKit/600.2.5 (KHTML, like Gecko) Version/8.0.2 Safari/600.2.5 (Amazonbot/0.1; +https://developer.amazon.com/support/amazonbot)
          100 Mozilla/5.0 (Linux; Android 6.0.1; Nexus 5X Build/MMB29P) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/122.0.6261.94 Mobile Safari/537.36 (compatible; GoogleOther)
           53 Mozilla/5.0 (Linux; Android 6.0.1; Nexus 5X Build/MMB29P) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/122.0.6261.94 Mobile Safari/537.36 (compatible; Googlebot/2.1; +http://www.google.com/bot.html)
           52 Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_5) AppleWebKit/605.1.15 (KHTML, like Gecko) Version/13.1.1 Safari/605.1.15 (Applebot/0.1; +http://www.apple.com/go/applebot)
           50 Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; GPTBot/1.0; +https://openai.com/gptbot)
           36 SPIP-3.2.19 (https://www.spip.net)
           25 Mozilla/5.0 (Linux; Android 5.0) AppleWebKit/537.36 (KHTML, like Gecko) Mobile Safari/537.36 (compatible; Bytespider; spider-feedback@bytedance.com)
           23 Mozilla/5.0 (compatible; AhrefsBot/7.0; +http://ahrefs.com/robot/)
           23 Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; bingbot/2.0; +http://www.bing.com/bingbot.htm) Chrome/116.0.1938.76 Safari/537.36
      BigGrizzly @biggrizzly CC BY-NC-SA
    • @sombre
      Sombre @sombre CC BY-NC-SA 25/04/2024

      Des bots qui récupèrent l’intégralité de Seenthis ...

      #it_has_begun

      Sombre @sombre CC BY-NC-SA
    • @mfmb
      MFMB @mfmb 26/04/2024
      @biggrizzly @sombre

      Vous pouvez expliquer pour les mal comprenant‧es comme moi par exemple ? Merci @biggrizzly @sombre

      MFMB @mfmb
    • @biggrizzly
      BigGrizzly @biggrizzly CC BY-NC-SA 26/04/2024

      Ce matin, 8h06.

          208 Mozilla/5.0 (Linux; Android 6.0.1; Nexus 5X Build/MMB29P) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/122.0.6261.94 Mobile Safari/537.36 (compatible; Googlebot/2.1; +http://www.google.com/bot.html)
          194 Mozilla/5.0 (Linux; Android 6.0.1; Nexus 5X Build/MMB29P) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/122.0.6261.94 Mobile Safari/537.36 (compatible; GoogleOther)
           52 facebookexternalhit/1.1 (+http://www.facebook.com/externalhit_uatext.php)
           43 Mozilla/5.0 (Linux; Android 5.0) AppleWebKit/537.36 (KHTML, like Gecko) Mobile Safari/537.36 (compatible; Bytespider; spider-feedback@bytedance.com)
           43 Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; bingbot/2.0; +http://www.bing.com/bingbot.htm) Chrome/116.0.1938.76 Safari/537.36
           42 Mozilla/5.0 (Macintosh; Intel Mac OS X 10_10_1) AppleWebKit/600.2.5 (KHTML, like Gecko) Version/8.0.2 Safari/600.2.5 (Amazonbot/0.1; +https://developer.amazon.com/support/amazonbot)
           42 Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; ClaudeBot/1.0; +claudebot@anthropic.com)
           38 Mozilla/5.0 (compatible; AhrefsBot/7.0; +http://ahrefs.com/robot/)
           35 Sogou Pic Spider/3.0(+http://www.sogou.com/docs/help/webmasters.htm#07)
           34 Mozilla/5.0 (compatible; DataForSeoBot/1.0; +https://dataforseo.com/dataforseo-bot)

      Explications :
      – Chaque visiteur utilise un logiciel qui télécharge les pages et les images des pages qu’il visite.
      – Chacune des ressources téléchargées génère une ligne de journal dans un fichier dit de « log ».
      – Le logiciel, à chaque téléchargement, transmet une chaîne de caractère que l’on nomme « user agent ». C’est le nom du logiciel utilisé, y compris des informations sur le système d’exploitation, et pleins d’autres choses potentiellement.
      – Les 10 lignes que je présente sont issues des 1000 dernières lignes de journal regroupées sur le « user agent », avec un décompte du nombre d’occurrences de chacun.

      Dans ce dernier export, on constate que les 10 premiers « user agent » représentent 73,1% de l’activité. Et que ceux-ci sont à 100% des robots.

      BigGrizzly @biggrizzly CC BY-NC-SA
    • @sombre
      Sombre @sombre CC BY-NC-SA 26/04/2024
      @biggrizzly @mfmb

      @biggrizzly : Est-ce que ces activités « supra normales » induisent qu’on ait souvent des erreurs « 502 bad gateway » lors d’une tentative de connection ? Moi, pas plus tard qu’hier soir (et de plus en plus fréquemment ces dernières semaines).

      @mfmb : je n’ai pas l’expertise de Big Grizzly dans le domaine du web. Mais quand j’apprends que des bots (machines plus ou moins autonomes car automatisées) se mettent à aspirer les données d’une plateforme comme Seenthis, je me pose la question : mais où vont les octets ? Et quelle la nature de l’interface fauteuil-clavier (le gugusse qui est aux manettes) qui se permet de faire ça.

      #surveillance (?)
      (spoiler : yes)

      Sombre @sombre CC BY-NC-SA
    • @biggrizzly
      BigGrizzly @biggrizzly CC BY-NC-SA 26/04/2024

      L’humain soucieux d’éduquer sa progéniture lui donne accès aux livres et aux écoles. Les capitalistes, soucieux de remplacer l’humain, donnent accès à leurs robots aux contenus des réseaux sociaux. Leurs robots pompent tous les échanges humains (écrits, dessins, vidéos) dans l’espoir de créer une intelligence artificielle plus performante que celle du capitaliste voisin, pour enfin pouvoir se passer des humains.

      Pomper l’intégralité de SeenThis, ça brûle des ressources, oui, on ferait mieux de leur transmettre directement la base de données... Ils ont de leur côté décidé qu’ils avaient des moyens illimités. Ils construisent des datacenters uniquement pour ce besoin là. C’est consternant d’inutilité. Mais il en ressortira quelque chose, assurément. Avec ou sans nous.

      BigGrizzly @biggrizzly CC BY-NC-SA
    • @colporteur
      colporteur @colporteur CC BY-NC-SA 26/04/2024

      La capture capitaliste du travail gratuit se veut illimitée.

      #IA #travail_gatuit

      colporteur @colporteur CC BY-NC-SA
    • @biggrizzly
      BigGrizzly @biggrizzly CC BY-NC-SA 26/04/2024

      J’omets de répondre à ta question, désolé. Oui, ces erreurs récurrentes, les difficultés à publier ou à répondre, c’est à cause des bots.

      Mais comme je l’indique dans une de mes réponses, je ne comprends pas pourquoi les bots ne sont pas refusés (erreur 503), quand la charge de la machine est élevée. J’ai l’impression que lors de la dernière mise à jour, la fonctionnalité a été désactivée, ou quelque chose du genre, et c’est pour cela qu’il serait bon qu’un spécialiste aille regarder, s-il-vous-plait-merci-d-avance.

      BigGrizzly @biggrizzly CC BY-NC-SA
    • @mfmb
      MFMB @mfmb 26/04/2024
      @sombre @biggrizzly

      Merci pour les explications. @sombre @biggrizzly

      MFMB @mfmb
    • @ericw
      EricW @ericw CC BY-SA 26/04/2024

      Je viens de passer une journée a les virer d’un forum. Mardi c’était devenu infernal.
      Pour certains c’est assez simple, ils respectent le robots.txt. openai et je ne sais plus quel autre donnent leurs adresse avec le masque cidr qui va bien. Je ne suis pas admin de la machine (donc pas moyen de configurer le pare-feu) mais avec une section <Limit> dans un fichier .htaccess ça marche.
      Reste les plus agressifs : bytedance, amazon et quelques autres. J’ai pas la plage IP de ceux la.
      Certains t’expliquent sans rire qu’ils relisent le robot.txt tous les 10 jours ! J’ai ajouté des règles de réécriture qui leur balance des erreurs 403. En 24h tout est redevenu normal.

      EricW @ericw CC BY-SA
    • @biggrizzly
      BigGrizzly @biggrizzly CC BY-NC-SA 26/04/2024

      J’en cause plus généralement aussi ici :
      ▻https://seenthis.net/messages/1051005

      BigGrizzly @biggrizzly CC BY-NC-SA
    • @biggrizzly
      BigGrizzly @biggrizzly CC BY-NC-SA 26/04/2024

      9h43, 100% de robots dans les 840 dernières lignes du journal.

          458 Mozilla/5.0 (Linux; Android 6.0.1; Nexus 5X Build/MMB29P) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/122.0.6261.94 Mobile Safari/537.36 (compatible; GoogleOther)
          176 Mozilla/5.0 (Linux; Android 6.0.1; Nexus 5X Build/MMB29P) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/122.0.6261.94 Mobile Safari/537.36 (compatible; Googlebot/2.1; +http://www.google.com/bot.html)
           33 facebookexternalhit/1.1 (+http://www.facebook.com/externalhit_uatext.php)
           28 Mozilla/5.0 (Macintosh; Intel Mac OS X 10_10_1) AppleWebKit/600.2.5 (KHTML, like Gecko) Version/8.0.2 Safari/600.2.5 (Amazonbot/0.1; +https://developer.amazon.com/support/amazonbot)
           28 Mozilla/5.0 (Linux; Android 5.0) AppleWebKit/537.36 (KHTML, like Gecko) Mobile Safari/537.36 (compatible; Bytespider; spider-feedback@bytedance.com)
           27 Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; bingbot/2.0; +http://www.bing.com/bingbot.htm) Chrome/116.0.1938.76 Safari/537.36
           24 Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; ClaudeBot/1.0; +claudebot@anthropic.com)
           21 Mozilla/5.0 (compatible; DataForSeoBot/1.0; +https://dataforseo.com/dataforseo-bot)
           20 Sogou Pic Spider/3.0(+http://www.sogou.com/docs/help/webmasters.htm#07)
           18 Mozilla/5.0 (compatible; AhrefsBot/7.0; +http://ahrefs.com/robot/)
      BigGrizzly @biggrizzly CC BY-NC-SA
    • @b_b
      b_b @b_b PUBLIC DOMAIN 26/04/2024
      @biggrizzly @seenthis

      Mince je n’avais pas vu tes pings @biggrizzly (normal le ping vers @seenthis n’est plus relayé sur discourse), n’hésite pas à me pinger en direct :)

      Si les bots ne sont pas bloqués, il y a deux pistes : soit leur user agent n’est pas dans la liste déclaré par l’écran de sécu de SPIP cf ▻https://git.spip.net/spip-contrib-outils/securite/-/blob/master/ecran_securite.php?ref_type=heads#L44 ou alors PHP n’a pas accès à sys_getloadavg cf ▻https://git.spip.net/spip-contrib-outils/securite/-/blob/master/ecran_securite.php?ref_type=heads#L740

      b_b @b_b PUBLIC DOMAIN
    • @biggrizzly
      BigGrizzly @biggrizzly CC BY-NC-SA 26/04/2024
      @b_b

      Merci pour les pistes @b_b. Depuis, donc, un certain temps, ça génère du 429, au lieu de 503. Je n’avais pas vu. Du coup, je constate que ça vire du monde, déjà. Et je constate, donc, que ça n’exclut pas beaucoup de bot, du fait de la règle qui est très peu excluante. La règle actuelle ne suffit pas. Je vais modifier la règle, en la rendant très excluante, et on va voir si ça va mieux. Merci encore.

      BigGrizzly @biggrizzly CC BY-NC-SA
    • @b_b
      b_b @b_b PUBLIC DOMAIN 26/04/2024
      @biggrizzly

      @biggrizzly la règle est retreinte à cause du fichier ecran_secrite_config.php qui défini une règle perso, alors que celle de SPIP est bien plus large. On en cause en direct sur IRC ou autre si tu veux.

      b_b @b_b PUBLIC DOMAIN
    • @biggrizzly
      BigGrizzly @biggrizzly CC BY-NC-SA 26/04/2024

      Depuis que j’ai compris que ça déclenchait des 429 plutôt que des 503, j’ai pu adapter mes scripts (basiques) d’analyse des logs, et je vois désormais qu’il y a bien un effet de la part de ce système.

      Comme tu dois pouvoir le voir, j’ai ajouté des filtres très génériques. Apparemment, le load ne monte plus au dessus de 2, pour le moment. A suivre. Et j’espère qu’il n’y a pas de user-agent légitime qui contient « bot »... :-))

      BigGrizzly @biggrizzly CC BY-NC-SA
    • @b_b
      b_b @b_b PUBLIC DOMAIN 26/04/2024

      this machine kills bots ^^

      b_b @b_b PUBLIC DOMAIN
    • @b_b
      b_b @b_b PUBLIC DOMAIN 28/04/2024
      @biggrizzly

      @biggrizzly on est pas les seules personnes à subir claudebot cf ▻https://mastodon.social/@nixCraft/112344003877391227

      Et je commence aussi à observer des rush de ce bot chez infini.

      b_b @b_b PUBLIC DOMAIN
    • @sombre
      Sombre @sombre CC BY-NC-SA 29/04/2024

      #AI_chatbot

      Sombre @sombre CC BY-NC-SA
    • @biggrizzly
      BigGrizzly @biggrizzly CC BY-NC-SA 29/04/2024

      On a de la chance que ces bots s’identifient avec un user agent, et des plages ip. Ils ne sont pas totalement malveillant non plus.

      BigGrizzly @biggrizzly CC BY-NC-SA
    • @biggrizzly
      BigGrizzly @biggrizzly CC BY-NC-SA 29/04/2024

      Puisqu’on en parle, des bots pas sympa, en voilà un gratiné. Si on se demande pourquoi pendant 5 minutes SeenThis était difficile d’accès, on peut demander des comptes au user-agent suivant : Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/116.0.0.0 Safari/537.36

      Dans les 1000 dernières lignes de log, il communiquait avec SeenThis depuis 4 adresses IP :

           87 183.192.118.124
           30 183.192.118.126
           18 183.192.118.18
          137 183.192.118.26

      Nous avons donc des bots qui tentent de se faire passer pour autre chose qu’un bot.

      BigGrizzly @biggrizzly CC BY-NC-SA
    • @marcimat
      marcimat @marcimat 30/04/2024

      De notre côté on s’est fait aussi pourrir par un ClaudeBot…
      Y en a un (je sais pas si c’est le même) qui change son UserAgent à chaque hit aussi…

      marcimat @marcimat
    Écrire un commentaire
  • @biggrizzly
    BigGrizzly @biggrizzly CC BY-NC-SA 16/09/2023
    4
    @ericw
    @biggrizzly
    @spip
    @colporteur
    4

    Faut-il bloquer ça ?
    Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko ; compatible ; GPTBot/1.0 ; +►https://openai.com/gptbot)

    Quel est le moyen le plus aisé de virer tous les bots ? J’y serais personnellement favorable. :-)

    BigGrizzly @biggrizzly CC BY-NC-SA
    • @ktche
      ktche @ktche CC BY-NC-SA 16/09/2023

      ▻https://github.com/mitchellkrogza/nginx-ultimate-bad-bot-blocker
      ▻https://github.com/mitchellkrogza/apache-ultimate-bad-bot-blocker

      ktche @ktche CC BY-NC-SA
    • @biggrizzly
      BigGrizzly @biggrizzly CC BY-NC-SA 16/09/2023
      @seenthis

      @seenthis, un avis ?

      BigGrizzly @biggrizzly CC BY-NC-SA
    • @biggrizzly
      BigGrizzly @biggrizzly CC BY-NC-SA 18/09/2023
      @ktche

      Merci @ktche pour la suggestion. Je vais l’étudier (pour nginx), et sans doute la mettre en œuvre sur SeenThis. J’espère que c’est compatible avec la vieille version de Debian... sinon, ça m’encouragera à réaliser la migration.

      @tous : les moteurs de recherche vont être globalement exclus, ils ne pourront plus parcourir SeenThis qu’en étant anonymes.

      BigGrizzly @biggrizzly CC BY-NC-SA
    • @arno
      ARNO* @arno ART LIBRE 18/09/2023
      @fil

      Sur pas mal de sujets, Seenthis tombe bien dans une recherche Google, parce que les longs threads sont intéressants. Du coup je ne comprends pas quel intérêt on aurait à se priver d’un bon référencement.

      Pour rappel, Seenthis a un fonctionnement volontairement différent de la plupart des réseaux sociaux : il est conçu pour pouvoir être de manière libre, comme n’importe quelle page Web, sans demander à ce qu’on s’y inscrive (même Bluesky, je ne peux même pas voir la page de @fil sans y avoir moi-même un compte). Et dans les chiffres de visites que j’avais, c’était bien le cas : beaucoup plus de visites que d’inscrits.

      C’est-à-dire qu’on est dans une logique plus proche du blog que du pur réseau social, donc on dépend pour une large part du fait que les excellents threads de qualité qu’on a ici fonctionnent comme des pages de blog et donc doivent être correctement référencés.

      (C’est aussi pour ça que j’ai depuis le début ce système de micro-caches imbriqués pour tenter de rigoureusement limiter les recalculs avec accès mySQL lors du passage d’un robot sur l’ensemble du site.)

      ARNO* @arno ART LIBRE
    • @biggrizzly
      BigGrizzly @biggrizzly CC BY-NC-SA 18/09/2023

      Je n’ai pas la même expérience que toi concernant les recherches sur SeenThis ; je ne retrouve jamais mes posts techniques, par exemple, si je les cherche avec les mots clefs qui vont bien (par exemple pour de la table de hash pour authentifier les connexions SMTP sur postfix).

      L’autre jour, j’avais une surcharge sur le serveur. Toute la semaine, on en a eu. Et là, ce jour-là, c’était openai. Une autre fois, c’était un bot de capture d’images. Et une autre fois, c’était un bidule qui faisait du post sur toutes les URL qu’il trouvait...

      Mais si ça vous va qu’on laisse les moteurs lire ce qu’on partage, ma foi, je laisse les choses en l’état, en me contentant de virer les ips les plus dommageables, au coup par coup.

      BigGrizzly @biggrizzly CC BY-NC-SA
    • @arno
      ARNO* @arno ART LIBRE 18/09/2023

      Pour moi ce sont les moteurs de recherche qui doivent passer (GoogleBot notamment). Les autres je vois pas d’intérêt immédiat (les bots d’images, a priori, ça n’a même rigoureusement aucun intérêt puisqu’on n’héberge aucune image).

      ARNO* @arno ART LIBRE
    • @biggrizzly
      BigGrizzly @biggrizzly CC BY-NC-SA 23/09/2023

      Top 10 par user-agent à l’instant, que le serveur est surchargé : que des bots, dont 2 avec UA vide.

      Sogou Pic Spider/3.0(+http://www.sogou.com/docs/help/webmasters.htm#07)
      Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; bingbot/2.0; +http://www.bing.com/bingbot.htm) Chrome/103.0.5060.134 Safari/537.36
      Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_5) AppleWebKit/605.1.15 (KHTML, like Gecko) Version/13.1.1 Safari/605.1.15 (Applebot/0.1; +http://www.apple.com/go/applebot)
      Mozilla/5.0 (compatible; YandexRenderResourcesBot/1.0; +http://yandex.com/bots) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/108.0.0.0
      Mozilla/5.0 (compatible; MJ12bot/v1.4.8; http://mj12bot.com/)
      -
      SPIP-3.2.19 (https://www.spip.net)
      Mozilla/5.0 (Linux; Android 7.0;) AppleWebKit/537.36 (KHTML, like Gecko) Mobile Safari/537.36 (compatible; PetalBot;+https://webmaster.petalsearch.com/site/petalbot)
      
      Mozilla/5.0 (compatible; SemrushBot/7~bl; +http://www.semrush.com/bot.html)
      BigGrizzly @biggrizzly CC BY-NC-SA
    • @arno
      ARNO* @arno ART LIBRE 23/09/2023

      Ma phrase est mal formée : « pour moi, ce sont les moteurs de recherche qui doivent pouvoir continuer à passer ». Je voulais dire qu’à mon avis, tu peux tout bloquer, sauf les principaux moteurs de recherche, si on peut faudrait au moins garder GoogleBot et Bing (les Russes et les Chinois, je suis pas certain que ce soit bien utile…).

      ARNO* @arno ART LIBRE
    • @colporteur
      colporteur @colporteur CC BY-NC-SA 23/09/2023

      hum... même pour retrouver ici le compte de LC dont il est question avant clôture, j’ai du (faute d’imagination, de savoir ?) passer par gougueule

      colporteur @colporteur CC BY-NC-SA
    • @biggrizzly
      BigGrizzly @biggrizzly CC BY-NC-SA 26/09/2023
      @b_b @seenthis @rastapopoulos @arno

      @b_b, @seenthis, @rastapopoulos, @arno, @tous : un endroit simple d’accès pour discuter du prochain serveur virtuel de ST ? Le serveur actuel est un vieux serveur Debian. Le mettre à jour à l’arrache devrait pouvoir fonctionner, mais je me disais qu’on pouvait aussi monter un serveur tout neuf. Il y a tout de même quelques composants obsolètes il me semble (sphinx ?)... MAIS. Je n’ai raisonnablement pas de temps à consacrer autre que : fournir la Debian vierge et l’IP publique temporaire.

      BigGrizzly @biggrizzly CC BY-NC-SA
    • @b_b
      b_b @b_b PUBLIC DOMAIN 26/09/2023
      @biggrizzly

      @biggrizzly ►https://web.libera.chat/#seenthis ?

      b_b @b_b PUBLIC DOMAIN
    • @rastapopoulos
      RastaPopoulos @rastapopoulos CC BY-NC 26/09/2023

      Ou même encore un ticket quelque part dans : ►https://github.com/seenthis ?

      RastaPopoulos @rastapopoulos CC BY-NC
    • @biggrizzly
      BigGrizzly @biggrizzly CC BY-NC-SA 26/09/2023

      Il faudrait amtha un minimum d’asynchronicité et de persistance :-))
      J’ai trouvé pour me reconnecter à Github.

      BigGrizzly @biggrizzly CC BY-NC-SA
    • @mfmb
      MFMB @mfmb 26/09/2023

      Je comprends rien à vos échanges. J’ose ! Et je me demande si vous pouviez m’aider... J’étais abonnée à uptobox qui a fermé. Peux plus télécharger les séries ! Auriez vous des infos ?

      MFMB @mfmb
    • @arno
      ARNO* @arno ART LIBRE 26/09/2023

      Sinon j’ai fait des petits commits sur seenthis-squelettes. Du text-wrap:pretty et du {This machine kills fascists}. Si quelqu’un veut pousser en prod.

      ARNO* @arno ART LIBRE
    • @b_b
      b_b @b_b PUBLIC DOMAIN 26/09/2023
      @arno

      @arno c’est fait

      b_b @b_b PUBLIC DOMAIN
    • @arno
      ARNO* @arno ART LIBRE 26/09/2023

      Merci ! Si la mention « This machine kills fascists » ne permet pas de nous protéger contre les bots qui nous font grimper la charge, je ne vois pas ce qu’on pourra faire de plus…

      ARNO* @arno ART LIBRE
    • @biggrizzly
      BigGrizzly @biggrizzly CC BY-NC-SA 27/09/2023

      J’ignore comment vous voulez procéder pour discuter sur Github. Je vous laisse m’indiquer où on cause.
      Pour info, actuellement, ST c’est 240Go de fichiers, et 17Go de base MariaDB.

      BigGrizzly @biggrizzly CC BY-NC-SA
    Écrire un commentaire
  • @brujitafr
    brujitafr @brujitafr 15/10/2014

    Les rats envahissent New York
    ▻http://www.brujitafr.fr/article-les-rats-envahisent-new-york-124788995.html

    http://www.bing.com/az/hprichbg/rb/WallStreetNY_FR-FR9293687068_1366x768.jpg

    Les plaintes au sujet des petits rongeurs indésirables ont augmenté l’an dernier de près de 10% dans la Grosse Pomme. Les autorités sanitaires ne font pas assez pour lutter contre, dénonce un responsable de la ville. « Tous les jours, les rats sont une insulte aux New-Yorkais, qui donne envie de vomir », a martelé le contrôleur financier de la ville Scott Stringer, après avoir rendu public ce week-end un audit sur la façon dont ce problème était géré par les services municipaux de la santé et de l’hygiène (DOHMH). « Nous perdons la course contre les rats », s’est-il inquiété. « Ils sont trop nombreux et nous avons besoin d’un vrai plan d’action pour régler ce problème ». Selon cet audit, un quart des plaintes reçues au 311 (numéro public pour les plaintes non urgentes) pour l’année (...)

    • #Scott Stringer
    brujitafr @brujitafr
    Écrire un commentaire
  • @olivier_sc
    Olivier-SC @olivier_sc 30/11/2013

    Palmarès de quelques moteurs : la recherche Schol Meaix sur Bing propose 12 résultats une fois que l’on confirme l’orthographe saisie. Yahoo ! ne propose même pas l’orthographe saisie et persiste dans les 2O... Comme Google qui reste en dessous de tout sur ce coup là et, après l’avoir forcé sur cette saisie en recherche Blog, on obtient toujours que 3 résultats... Voici qui me fait mal aux tripes, mais sur cette recherche : vive Bing !... Pour ceux qui ont loupé l’épisode 1 : Schol Meaix et le Lapin de jade (Exercice)... ▻http://www.bing.com/search?q=%2bSchol+Meaix&filters=rcrse%3a%221%22&FORM=RCRE
    ▻http://blogoliviersc.org/?p=7354
    #palmarès #moteurs #shol_meaix

    • #Google
    • #Yahoo!
    Olivier-SC @olivier_sc
    • @olivier_sc
      Olivier-SC @olivier_sc 30/11/2013

      Et j’insiste afin que Google parvienne à repérer : Shol Meaix = ▻https://plus.google.com/u/0/114108954249717412482/posts/MSDgQpgKA29
      ▻http://www.kweeper.com/oliviersc75/sentence/453039

      Olivier-SC @olivier_sc
    • @olivier_sc
      Olivier-SC @olivier_sc 30/11/2013

      Un petit tweet en plus ;) ▻https://twitter.com/oliviersc/status/406831692804935681

      Olivier-SC @olivier_sc
    • @olivier_sc
      Olivier-SC @olivier_sc 30/11/2013

      Et puis, la #Revue de #blogs : Schol Meaix et la Zenitude = ▻http://blogoliviersc.org/?p=7370

      Olivier-SC @olivier_sc
    • @olivier_sc
      Olivier-SC @olivier_sc 1/12/2013

      Déclarer : Schol Meaix vs Google dans : Schol Meaix et la Zenitude - Palmarès de 3 moteurs sur une recherche... Podium : Bing (12), Google (3), Yahoo ! (0) à Friendfeed - Delicious.
      ▻http://friendfeed.com/oliviersc/830b23f0/schol-meaix-vs-google-dans-et-la-zenitude
      ▻https://delicious.com/oliviersc5

      Olivier-SC @olivier_sc
    Écrire un commentaire
  • @cripure
    CRIPURE @cripure 8/04/2012

    http://www.musicacolta.eu/mc/wp-content/uploads/2009/10/billie-holiday.jpg

    Billie Hollyday - Bing Videos
    ►http://www.bing.com/videos/search?q=Billie+Hollyday&view=detail&mid=364F06A669DFEEA9B4E3364F06A669DFEEA9B

    CRIPURE @cripure
    Écrire un commentaire
  • @arno
    ARNO* @arno ART LIBRE 17/05/2011

    Bing Facebook Friends Now Fueling Faster Decisions on Bing - Search Blog - Site Blogs - Bing Community
    ►http://www.bing.com/community/site_blogs/b/search/archive/2011/05/16/news-announcement-may-17.aspx

    Today, Bing is bringing the collective IQ of the Web together with the opinions of the people you trust most, to bring the “Friend Effect” to search. Starting today, you can receive personalized search results based on the opinions of your friends by simply signing into Facebook. New features make it easier to see what your Facebook friends “like” across the Web, incorporate the collective know-how of the Web into your search results, and begin adding a more conversational aspect to your searches. Decisions can now be made with more than facts, now the opinions of your trusted friends and the collective wisdom of the Web.

    ►http://www.youtube.com/watch?v=xPYVqHZKF2g

    Attention, cette vidéo fait un petit peu peur.

    #facebook #microsoft #bing #there_goes_your_private_life

    • #Facebook
    • #personalized search results
    • #search results
    ARNO* @arno ART LIBRE
    Écrire un commentaire
  • @fil
    Fil @fil 2/02/2011
    1
    @aris
    1

    #Google: #Bing Is #Cheating, Copying Our Search Results
    ►http://searchengineland.com/google-bing-is-cheating-copying-our-search-results-62914

    espionnage industriel 2.0 chez les moteurs de recherche (marrant) :

    Google has run a sting operation that it says proves Bing has been watching what people search for on Google, the sites they select from Google’s results, then uses that information to improve Bing’s own search listings.

    • #Google
    • #search listings
    • #search result pages
    • #Bing Is Cheating
    Fil @fil
    • @fil
      Fil @fil 3/02/2011

      la réponse de Mr Bing-O ►http://www.bing.com/community/site_blogs/b/search/archive/2011/02/02/setting-the-record-straight.aspx

      Fil @fil
    • @fil
      Fil @fil 4/02/2011

      mieux :

      Bing isn’t mining the first pages on Google search result pages as Google claims; they’re mining the pages that users click on the most.

      ►http://fury.com/2011/02/a-surprising-opinion-on-the-bing-is-copying-google-controversy

      Fil @fil
    Écrire un commentaire