Re: Falsche Grafik! Richtige Auswertung kommt jetz
Hallo Jens,
ich möchte nun auf die konkrete Auswertung eingehen, die Du mir geschickt hast.
Du schreibst "Ach ja, nicht über die Nachkommastellen wundern. Es sind zu viele .."
So etwas wie zu viele Nachkommastellen bei berechneten Werten gibt es nicht.
Ich vermute Du hast in der Schule wie ich auch gelernt, dass man nicht mehr Nachkommastellen angeben soll, als man bei den Eingangsdaten angibt.
Das stammt aus Zeiten, in denen man alles per Hand rechnen musste. Bei Verwendung von Computern ist das überholt.
Warum man das früher gemacht hat:
Es dauert bis ein Mensch zum Beispiel 10000 Multiplikationen durchgeführt hat. Man hat 2 Möglichkeiten solche Berechnungen effektiv durchzuführen:
1. Mann nimmt große n und rechnet mit wenig Nachkommastellen.
2. Man nimmt kleinere n und rechnet mit mehr Nachkommastellen.
Die Erfahrung hat gezeigt, dass Methode 1 die besseren Resultate bringt.
Für die Darstellung von Messwerten gelten andere Regeln, die auch bei einer Eichung geprüft werden.
Messwerte dürfen nicht genauer angegeben werden als die Genauigkeit, für die das Messinstrument geeicht ist.
Für Auswertungen - wie zum Beispiel Mittelwert oder Streuung - gilt das nicht, da dürfen zusätzliche Nachkommastellen angegeben werden.
Diese Vorgaben kann man nur verstehen, wenn man sich ein wenig mit numerischer Mathematik befasst. Stichwort Fehlerfortplanzung
Ich gebe ein Beispiel, welche Fehler man sich einhandelt, wenn man zu früh rundet:
X1 = 1.231
X2 = 1.232
( X2 - X1 ) * 1000
ergibt 1 wenn ungerundet
0 wenn auf 2 Stellen gerundet.
Das ist jetzt ein Trivialbeispiel.
Es gibt aber leider auch so etwas ähnliches wie eine Rundung, wenn man eine Gleitkommazahl im Computer speichert.
Es wird nie der tatsächliche Wert gespeichert, sondern der Wert aus dem Wertevorrat, der ihm am nächsten ist.
Python hat 64Bit Gleitkommazahlen. Das ist zwar recht genau, aber auch damit kann man in das Problem laufen, dass ein korrekter Algorithmus aus Gründen der numerischen Mathematik völlig falsche Ergebnisse liefert.
Im Studium empfahl man darum, immer eine Probe zu machen und zeigte abschreckende Beispiele, bei denen zum Beispiel ein Gaußscher Algorithmus zur Lösung von n Gleichungen mit n Unbekannten Unsinn berechnete.
Wie oben gezeigt sind insbesondere Differenzen von fast gleichen Werten gefährlich. Man sollte das immer im Auge behalten.
Der Varianzschätzer verwendet zum Beispiel eine Differenz.
Nun zu deinem Bild. Du gibst nicht an, wie groß n war.
Ich kann nur raten, dass es eher klein war, weil Du nur 6 Balken gebildet hast.
Ich habe mich hier ein wenig sachkundig über KDE Kurven gemacht:
https://de.wikipedia.org/wiki/Kerndichteschätzer
Auszug:
"Man sieht deutlich, dass die Qualität des Kerndichteschätzers von der gewählten Bandbreite abhängt.
Eine zu kleine Bandbreite erscheint „verwackelt“, während eine zu große Bandbreite zu „grob“ ist."
Deine Darstellung scheint mir zu grob zu sein.
Wenn Du aber feiner einteilst, hast Du vermutlich eine stark "verwackelte" Grafik, weil das n so klein ist, dass Einzelmessungen einen zu großen Einfluss haben.
Deine Grafik zeigt übrigens deutliche Ähnlichkeiten der statistischen Merkmale mit anderen Grafiken, die ich gesehen habe, die Sporenmessungen wiedergeben.
Die Verteilung ist deutlich schief, deshalb befinden sich auch Messwerte außerhalb der von Dir berechneten "Konfidenzintervalls".
Sie sind allerdings deutlich erkennbar nicht weit (in Bezug auf die geschätzte Streuung) von diesem Intervall entfernt.
Wie man dann auf den Gedanken kommt, diese Messwerte als Ausreißer auszuschließen, kann ich nicht nachvollziehen.
Ich würde daraus schließen, dass dein Schätzer für das Konfidenzintervall unzureichende Ergebnisse bringt und diese darum nicht angeben.
Vielleicht gibt es irgendwo jemanden, der für beliebige Verteilungen einen besseren Schätzer entworfen hat. Ich kenne so etwas nicht.
Zum Thema Ausreißertests möchte ich zunächst auf folgende Seite verweisen:
https://de.wikipedia.org/wiki/Ausreißer
Weiterhin wird hier ein Test angegeben, der ohne die Annahme Normalverteilung auskommt:
https://de.wikipedia.org/wiki/Ausreißertest_nach_Walsh
Hier ist explizit n=60 als nötig genannt.
Noch ein Nachtrag zum Buch von Werner Jurkeit.
Er zeigt unter anderem Mikrofotos verschiedener Arten, auf denen schon eine merkliche Anzahl von Sporen pro Art abgebildet sind.
Vielleicht vermesse ich die mal irgendwann und mache statistische Auswertungen.
Fotos haben den großen Vorteil, dass sie still halten und dass man sie kopieren kann.
Man kann dann vermeiden, dass eine Spore 2 Mal gemessen wird, indem man sie auf Papier markiert.
Wenn man keine Zeit mehr zum Weitermachen hat, kann man das am nächsten Tag machen.
Ich schau mich perspektivisch auch mal nach Programmen zur Mustererkennung um.
Gruß,
Marcel